Política y regulación
ArXiv prohibirá a autores por un año debido a contenido de IA no verificado
ArXiv impondrá una prohibición de un año a los autores que envíen investigaciones con contenido de IA no verificado, lo que marca una estricta ofensiva contra el uso de LLM en artículos científicos.
ArXiv, un repositorio abierto de investigaciones preprint (artículos de investigación publicados en un repositorio antes de someterse a revisión por pares), está implementando una nueva política de “un solo aviso”. Bajo esta norma, el repositorio prohibirá a los autores durante un periodo de 1 año si sus envíos contienen evidencia de que no verificaron el contenido generado por IA. Aunque los artículos en la plataforma se publican antes de ser revisados por pares, el repositorio sirve como canal principal para la difusión de investigaciones en campos como la informática y las matemáticas, y el sitio se ha convertido en una fuente de datos sobre tendencias en la investigación científica.
La actualización de la política fue publicada el jueves por Thomas Dietterich, presidente de la sección de informática de arXiv. Dietterich explicó que “si un envío contiene evidencia incontrovertible de que los autores no verificaron los resultados de la generación de LLM, esto significa que no podemos confiar en nada de lo que contiene el artículo”. Un LLM, o modelo de lenguaje grande, es un sistema de IA utilizado para generar texto. La política no es una prohibición total de estos modelos. En cambio, exige que los autores asuman toda la responsabilidad de sus envíos, independientemente de cómo se genere el contenido. La evidencia de una falta de verificación, como referencias alucinadas o comentarios directos hacia o desde un LLM, activará la sanción. Según Dietterich, la sanción consiste en una prohibición de 1 año en arXiv, seguida del requisito de que los envíos posteriores deban ser aceptados primero por un medio acreditado de revisión por pares. En una entrevista con el medio 404 Media, Dietterich señaló que los moderadores deben marcar el problema y los presidentes de sección deben confirmar la evidencia antes de imponer la sanción, y los autores podrán apelar.
La política aborda una preocupación más amplia con respecto al contenido basura de IA y las citas fabricadas en la literatura científica. Las investigaciones revisadas por pares indican que es probable que las citas fabricadas estén aumentando en la investigación biomédica. El cambio de política también coincide con cambios estructurales en el repositorio. Después de ser alojado por Cornell durante más de 20 años, arXiv está en transición para convertirse en una organización independiente sin fines de lucro, una transición que debería permitirle recaudar más fondos para abordar problemas como el contenido basura de IA.
Por qué importa
Esta política representa una escalada significativa en el esfuerzo de la comunidad científica por mantener la integridad de la investigación frente a la proliferación de contenido de baja calidad generado por IA. Al penalizar el uso no verificado de IA, el repositorio establece un estándar claro de responsabilidad para los investigadores que utilizan herramientas automatizadas.