needhelp
← Back to blog

La crisi delle gare di programmazione e algoritmi nell'era dell'IA

by needhelp
AI
Competitive Programming
Algorithm
Education
Academic Integrity

Un elenco non è un tasso

Il 30 agosto 2026, un post su X relativo alla prima manche del Baidu Star 2026 ha mostrato una tabella con 49 casi di cheating e una seconda tabella di violazioni. Il post parla di 49 casi di cheating e 63 violazioni, contro 30 persone coinvolte due anni prima. Le immagini mostrano 49 righe di cheating e 57 righe di violazioni: sono visibili le righe 1–25 e 32–63, mentre 26–31 mancano. È un segnale dell’incidente, non un dataset completo verificato in modo indipendente. Post originale

Le 106 righe visibili riguardano 87 scuole. La lista di cheating comprende 45 scuole, quella delle violazioni visibili 50. La maggioranza compare una sola volta; le tre scuole più frequenti rappresentano 6/49 righe nel primo elenco e 8/57 nel secondo. Il fenomeno appare quindi distribuito, non concentrato in pochi istituti.

Sullo stesso foglio compaiono scuole secondarie, università e istituti professionali. Senza il numero dei partecipanti e il tipo preciso di violazione, il conteggio delle righe non può diventare un tasso per scuola.

Le regole chiedono ora la provenienza del codice

La regola Codeforces del 2024 permette la traduzione diretta e piccoli suggerimenti sintattici, ma vieta di chiedere all’IA l’algoritmo principale, la spiegazione di un sottoproblema o la correzione di una soluzione respinta. La somiglianza del codice e la sua pubblicazione precedente alla gara possono essere segnali di indagine. Regola Codeforces

AtCoder ha recentemente esteso le regole ad AGC, vietato il completamento del codice con IA e la conversione tra linguaggi tramite IA, e limitato l’uso intenzionale dei riepiloghi di ricerca generati dall’IA. Il motivo è concreto: il confine tra completamento e sostituzione del ragionamento è difficile da controllare. Aggiornamento AtCoder

Nel 2022 DeepMind ha riferito che AlphaCode aveva raggiunto circa il livello del concorrente umano mediano in dieci gare Codeforces. Il rapporto AlphaCode 2 del 2023 indica il 43% di problemi risolti entro dieci tentativi, contro il 25% del primo sistema, con una prestazione media stimata sopra l’85° percentile. Un buon piazzamento non dimostra più automaticamente ragionamento umano senza assistenza. AlphaCode Rapporto AlphaCode 2

Anche i benchmark possono essere contaminati: i problemi pubblici possono finire nei dati di addestramento. LiveCodeBench raccoglie problemi nuovi da Codeforces, AtCoder e LeetCode e misura generazione, esecuzione, autoriparazione e previsione dell’output; la versione v6 elenca 1055 problemi pubblicati fino ad aprile 2025. Repository LiveCodeBench Articolo LiveCodeBench

Le gare dovrebbero distinguere modalità solo umana, con IA e didattica. La prima richiede dispositivo controllato, funzioni ammesse, log e ricorso; la seconda deve dichiarare modello, versione, prompt, modifiche e test; la terza deve far spiegare gli errori dell’IA e la verifica della soluzione. La programmazione competitiva non è finita, ma una classifica online non descrive più da sola tutte le capacità di uno studente. Regole IA del concorso di modellazione 2026

Riferimenti

Share this page