needhelp
← Volver al blog

La crisis de los concursos de programación y algoritmos en la era de la IA

por needhelp
AI
Competitive Programming
Algorithm
Education
Academic Integrity

Una lista no es una tasa

El 30 de agosto de 2026, una publicación de X sobre la primera ronda de Baidu Star 2026 mostró una tabla de 49 casos marcados como trampas y otra de infracciones. La publicación afirma que la primera tanda contiene 49 casos de trampa y 63 infracciones, frente a 30 personas implicadas dos años antes. Las imágenes muestran 49 filas de trampas y 57 de infracciones: aparecen las filas 1–25 y 32–63, pero faltan 26–31. Es una señal del incidente, no un conjunto completo verificado de forma independiente. Publicación original

Las 106 filas visibles abarcan 87 centros. La tabla de trampas tiene 49 filas de 45 centros; la tabla visible de infracciones tiene 57 filas de 50 centros. La mayoría de los centros aparece una sola vez. Los tres centros más frecuentes suman 6/49 filas en trampas y 8/57 en infracciones, por lo que el fenómeno parece disperso, no producido por unas pocas instituciones.

También aparecen escuelas secundarias, universidades e instituciones profesionales. Tres filas para una universidad no equivalen a una tasa: faltan el número de participantes, las condiciones de examen y el tipo exacto de infracción. Para comparar centros hacen falta un denominador y una definición estable.

Las reglas ahora preguntan por el origen del código

La regla de Codeforces de 2024 permite la traducción directa y pequeñas sugerencias sintácticas, pero prohíbe pedir a una IA el algoritmo central, la comprensión de un subproblema o la reparación de una solución rechazada. También menciona la similitud de código y su disponibilidad pública anterior como señales para investigar. Regla de Codeforces

AtCoder amplió recientemente sus reglas a AGC, prohibió la finalización de código mediante IA y la conversión de lenguajes con IA, y restringió el uso deliberado de resúmenes generados por IA en búsquedas. Su explicación es práctica: no resulta fácil vigilar una excepción de autocompletado cuando las sugerencias avanzadas pueden cruzar el límite sin una acción clara. Actualización de AtCoder

La primera crisis es de medición. Antes se suponía que el participante era el único agente que resolvía el problema. Hoy un concurso debe decir si evalúa a una persona, a una persona con herramientas o a un equipo que incluye un modelo remoto. Una casilla que diga “no usé IA” no es un registro de auditoría.

La IA cruzó el antiguo punto de referencia

En 2022, Google DeepMind informó que AlphaCode alcanzó aproximadamente el nivel del competidor mediano en diez concursos de Codeforces. Generaba muchos programas, los filtraba mediante ejecución y enviaba un pequeño grupo de candidatos. Ese proceso no es equivalente a que un estudiante escriba una solución desde cero. DeepMind sobre AlphaCode

El informe técnico de AlphaCode 2 de 2023 indicó que resolvía el 43% de los problemas evaluados en diez intentos, frente al 25% de AlphaCode, y estimó un rendimiento superior al del 85% de los participantes. Esto no significa que el modelo entienda todos los problemas; sí elimina la idea de que una posición alta demuestre razonamiento humano sin asistencia. Informe de AlphaCode 2

La contaminación afecta también a los benchmarks. LiveCodeBench recopila problemas nuevos de Codeforces, AtCoder y LeetCode, y evalúa generación, ejecución, autorreparación y predicción de salidas. Su versión v6 enumera 1055 problemas publicados hasta abril de 2025 y documenta que una buena puntuación en un benchmark antiguo no siempre se transfiere a problemas nuevos. Repositorio de LiveCodeBench Artículo de LiveCodeBench

Por eso los concursos deben responder qué mide realmente su puntuación: invención de algoritmos, velocidad de implementación, recuperación de información, coordinación de herramientas o una mezcla de todo ello.

Tres crisis distintas

La crisis de medición aparece cuando los participantes tienen entornos diferentes. Un modelo local, un agente en la nube y el trabajo sin asistencia no son condiciones equivalentes.

La crisis de aplicación aparece cuando un detector se convierte en juez. El estilo, los comentarios y los nombres de variables son pruebas débiles; la similitud, los registros de proceso y una defensa posterior pueden ayudar, pero también producen falsos positivos.

La crisis educativa aparece porque programar en producción incluye especificaciones, pruebas, depuración, revisión y decisiones sobre dependencias. Explicar un invariante y rechazar una respuesta plausible pero insegura puede ser más valioso que escribir rápidamente código que no se comprende.

Un rediseño posible

Los concursos deberían separar al menos tres modos:

  1. Solo humanos: un dispositivo controlado, una lista explícita de funciones permitidas, registros reproducibles, revisión de similitud y apelación.
  2. Con IA: declarar modelo, versión, herramientas, prompts, código generado, modificaciones, pruebas y, cuando proceda, coste y latencia; puntuar también la explicación y la verificación.
  3. Aprendizaje: permitir IA después del concurso, pero pedir al estudiante que marque qué propuso el modelo, qué estaba mal y cómo se comprobó la solución final.

Las reglas experimentales de 2026 del Concurso Nacional Universitario de Modelado Matemático de China incluyen modelos de lenguaje, IA generativa, asistentes de código y agentes. El cambio de vocabulario importa: usar IA ya no significa únicamente abrir una ventana de chat. Reglas de IA del concurso de modelado

La programación competitiva no ha desaparecido. Lo que debe desaparecer es la idea de que un único ranking en línea puede describir toda la capacidad de un estudiante. La próxima generación deberá publicar sus condiciones, registrar el proceso, separar resultados humanos y asistidos, y premiar explicaciones que sobrevivan a pruebas adversariales.

Referencias

Compartir esta página