Delší řetězec úvah automaticky neznamená kvalitnější výsledek. Model může opakovat stejnou strategii, vracet se k již odmítnutým cestám nebo přidávat text bez nové informace.

Práce Google DeepMind zkoumá, jak tyto vzorce rozpoznat ve struktuře generované úvahy. Takové měření může pomoci omezit náklady i latenci bez ztráty přesnosti.

Výsledky je třeba posuzovat podle konkrétních úloh a modelů. Z názvu publikace samotného nelze vyvozovat obecný recept pro všechny systémy.