¿Qué tan confiables son las respuestas de los chatbots? Proyecto Desconfío participó de una hackatón para ponerlos a prueba

Los chatbots de IA ya forman parte de las rutinas de búsqueda y consulta de millones de personas, pero sus respuestas no siempre son tan confiables como parecen. Pueden presentar datos falsos, mezclar información, omitir elementos relevantes o generar respuestas incorrectas con un tono convincente.

Según datos de Predictea presentados en la IV Cumbre Global sobre Desinformación, los sitios de desinformación creados con inteligencia artificial aumentaron un 1.124 %, mientras que los ciberataques crecieron un 104 %. En este contexto, entender cómo responden estas herramientas y qué tipo de errores pueden producir se vuelve cada vez más relevante.

Con esa pregunta como punto de partida, integrantes de Proyecto Desconfío participaron de una hackatón organizada por Chequeado, con el apoyo de la Unión Europea, que reunió a profesionales de distintas disciplinas para evaluar el desempeño de diferentes herramientas de inteligencia artificial. La propuesta buscó generar evidencia a partir de la experimentación directa con los modelos, utilizando una metodología común para identificar y registrar problemas en sus respuestas.

Los participantes trabajaron con ChatGPT, Gemini, Claude y el Modo IA de Google, utilizando cuentas nuevas para evitar que el historial previo influyera en los resultados. A partir de un guión de preguntas y una clasificación de problemas informativos, cada persona analizó las respuestas obtenidas y registró sus observaciones.

Además de la instancia de evaluación, la jornada permitió intercambiar experiencias entre profesionales de distintas disciplinas. En la puesta en común se compararon respuestas, se discutieron los errores y patrones encontrados y se compartieron criterios para analizar cuándo una respuesta aparentemente correcta presenta problemas de precisión, información o contexto.

La experiencia permitió observar en la práctica algunas de las dificultades que aparecen al utilizar chatbots de IA como herramientas para acceder a información. También dejó un espacio para seguir explorando cómo evaluar sus respuestas y qué criterios pueden ayudar a distinguir entre una respuesta plausible y una respuesta confiable.