Una traccia di ragionamento più lunga non produce automaticamente una risposta migliore. Il modello può ripetere una strategia o aggiungere testo senza nuove informazioni.

Il lavoro di Google DeepMind studia come riconoscere questi schemi. Misure simili potrebbero ridurre costo e latenza senza perdere accuratezza.

I risultati vanno interpretati per i compiti e i modelli testati. Il titolo della pubblicazione non offre da solo una ricetta universale.