Modellen har telt ferdig. Det engelske ordet raspberry har to r-er, hevder den.

Forskerne hindrer den i å avslutte. Der den skulle ha stoppet, setter de inn ett ord: «Wait».

Da fortsetter den. Den staver ordet og teller på nytt, og denne gangen kommer den til tre r-er. Et nokså beskjedent resultat for en språkmodell som hadde hele ordet foran seg. Forskerne bak s1 valgte å publisere nettopp dette eksemplet.

s1-rapporten, figur 3 (2025)

Modellen hadde allerede det den trengte for å svare riktig. Med beskjed om å fortsette klarte den det. Det åpner for å få mer ut av en ferdigtrent modell uten å trene den på nytt, forutsatt at det neste forsøket faktisk kan føre den et bedre sted.

s1 var finjustert på tusen utvalgte spørsmål med løsningsforløp fra en annen modell. Da forskerne tvang den til å fortsette, lå parametrene fast: Tallene som styrte beregningene, ble ikke endret. På matematikkprøven AIME 2024 målte de også bedre resultater med metoden. Bokstavtellingen var et utvalgt eksempel på hva som kunne skje.

Et mellomresultat som er skrevet ned, blir en del av grunnlaget for den neste beregningen. Finner modellen først at to størrelser er like, kan den arbeide videre med likheten i teksten foran seg. Den trenger ikke løse hele oppgaven i ett sprang. Men en feil kan få nøyaktig samme plass. Resten av forsøket kan bygges på noe som aldri stemte, og da hjelper det lite at den videre utregningen er omhyggelig. Mer plass gir modellen flere anledninger til å korrigere kursen, men også flere steder å gå seg vill.

Trening kan dessuten lære modellen å bruke denne plassen annerledes. Under treningen av DeepSeeks R1-Zero ble svarene lengre samtidig som matematikkresultatet steg. Modellen var allerede grunntrent; den videre treningen belønnet korrekthet og et bestemt svarformat. Underveis doblet forskerne også den tillatte svarlengden. Her endret parametrene seg mens forsøket pågikk. Vi kan derfor ikke lese kurven som et rent mål på hva modellen fikk igjen for å skrive mer.

Det er forskjell på å lære seg en bedre fremgangsmåte og å få mer tid til å bruke den man har. Har modellen lært en god metode, kan grundigere arbeid lønne seg. En dårlig metode blir ikke nødvendigvis bedre av at den får fortsette. Før vi gir maskinen enda mer å gjøre, må vi altså vite noe om hvordan det neste forsøket kan bli bedre enn det forrige.

Den kan for eksempel begynne på nytt. Flere forsøk gir flere veier gjennom oppgaven, men også et nytt problem: Hvilket svar skal vi beholde? En enkel løsning er å velge det som går igjen oftest. Metoden self-consistency ga på denne måten bedre resultater på flere tester, uten ny trening av modellen.

Da bruker vi enighet som tegn på at svaret er riktig. Vi har ikke fått en uavhengig kontroll. Alle forsøkene kommer fra samme modell, og en feil den lett gjentar, kan vinne avstemningen. Flere forslag er verdt noe når utvelgelsen klarer å finne et bedre svar blant dem.

En bedømmer kan også følge arbeidet frem til svaret. I et forsøk merket mennesker trinn i matematiske løsninger som riktige eller gale, med et nøytralt alternativ. Merkingen ble brukt til å trene en egen vurderingsmodell, som så skulle velge blant forslagene fra en modell som ble holdt fast. I de store forsøkene valgte den bedre enn en modell som bare vurderte sluttresultatet. De to vurderingsmodellene hadde riktignok ulikt treningsmateriale.

En del av fremgangen kan dermed komme av at vi blir flinkere til å finne det brukbare. Modellen behøver ikke produsere en løsning den aldri har vært i stand til å foreslå. Det kan holde at en bedre bedømmer finner den blant de andre forslagene.

I matematikk finnes det dessuten en strengere kontroll. Et bevis kan skrives i et formelt språk, med regler et program kan undersøke. Da hjelper det ikke å få argumentet til å høres overbevisende ut. Det må holde etter reglene.

AlphaProof brukte denne muligheten til å finne bevis for tre oppgaver fra matematikkolympiaden i 2024. Eksperter oversatte oppgavene til språket Lean, og systemet lette etter bevis Lean kunne godkjenne. For de tre løsningene tok den særskilte treningen under problemløsningen to til tre dager per oppgave. Deltagerne i den vanlige konkurransen hadde to økter på fire og en halv time hver. AlphaProof fikk med andre ord svært mye mer tid.

Og systemet brukte tiden til å lære underveis. Mens det forsøkte å løse en oppgave, trente AlphaProof på varianter av det konkrete problemet. Parametrene ble endret. Fordi bevisene kunne kontrolleres, kunne systemet lære av egne løsningsforsøk uten at et menneske måtte levere hvert bevis først. Det neste forsøket kunne komme fra en modell som var blitt bedre siden det forrige.

Her er det god grunn til å vente videre fremgang: En maskin kan undersøke langt flere forslag enn mennesker kan skrive ut for den, og den behøver ikke finne løsningen på samme måte som oss. Men den må ha et grunnlag for å beholde noen forsøk og forkaste andre. Når resultatene kan prøves mot presise kriterier, kan all denne beregningen gi noe å lære av.

Flertallsvalg: Wang mfl.Vurderingsmodell: Lightman mfl.Formell kontroll: AlphaProof

Selv et formelt bevis har en grense. Det godkjenner påstanden som faktisk er skrevet i det formelle språket. Om det var denne påstanden vi ønsket å få bevist, er et annet spørsmål. Arbeidet med å formulere hva som skal telle som et godt resultat, forsvinner ikke fordi vi har en maskin som kan lete etter det. Kan kriteriene kontrolleres, får forsøkene en retning. Er kriteriet bare at svaret virker godt, har usikkerheten også flyttet inn i bedømmelsen.

En lang, velformulert mellomtekst gir oss heller ingen garanti for innsyn. I forsøk med GPT-3.5 og Claude 1.0 kunne uvedkommende signaler i spørsmålet styre svaret uten at forklaringen nevnte påvirkningen. Begrunnelsen fortalte altså ikke hele historien om hva som hadde bestemt svaret.

Det er derfor fullt mulig at en mer avansert AI vil gjøre mye mer arbeid uten at brukeren får et lengre svar. Systemet kan forkaste en hel løsning, prøve en annen og sende et mellomresultat til kontroll. Gevinsten kan ligge i feilene som aldri slipper gjennom til den som spør.

Det betyr heller ikke at mest mulig beregning alltid er en god bruk av tiden. I forsøk med tilpassede PaLM 2-modeller fant Charlie Snell og medforfattere at den beste fordelingen mellom nye forsøk og bearbeiding av gamle avhang av hvor vanskelig oppgaven var for modellen. Å fordele innsatsen etter dette ga bedre utnyttelse av beregningene enn en fast metode. Men en del av regningen manglet: Det koster også beregninger å anslå hvor vanskelig oppgaven er, og den kostnaden var ikke tatt med i analysen.

Dermed blir også beslutningen om å fortsette en oppgave for systemet. Det bør kunne oppdage når et ekstra forsøk har en rimelig sjanse til å hjelpe. Har den aktuelle modellen ingen vei til en løsning, trenger den kanskje et annet verktøy eller et nytt faktagrunnlag. Å fortsette i samme spor kan bare gjøre feilen dyrere.

Ventetiden forteller oss heller ikke hvor mye arbeid som er gjort. Er maskinene tilgjengelige, kan flere forsøk kjøres samtidig. Brukeren får kanskje svaret raskt, mens det samlede arbeidet øker. En rekke avhengige mellomsteg må derimot vente på hverandre. To tjenester som bruker like mange sekunder på å svare, kan derfor ha brukt svært forskjellige mengder beregning. Stoppeuret teller ikke alt.

I s1-forsøket kom ordren om å vente utenfra. Forskerne hindret modellen i å stoppe, men da de gjentok inngrepet stadig flere ganger, flatet gevinsten ut. Modellen kunne ende i gjentakelser.

Et system som skal fordele innsatsen på egen hånd, trenger derfor også en vei ut. Det må kunne stoppe uten å ha funnet en løsning.