Da Nasjonalbiblioteket bygde språkmodellen NB-BERT, utelot forskerne all tekst som var skannet i årene 2006–2008. Programmet som skulle lese bokstavene, hadde gjort for mange feil og vært for sikkert på at det leste riktig. Tre års skanning måtte ut av treningsmaterialet.
Et bilde av en bokside er nok til at vi kan lese den. Skal vi søke etter ordene, må et program først gjøre tegnene på bildet om til digital tekst. Arbeidet kalles optisk tegngjenkjenning, gjerne forkortet OCR, og det er denne maskinleste teksten fritekstsøket i Nettbiblioteket leter gjennom.
På side 5 i Olaf Benneches Tordenskjold fra 1929 står det «Han kom også fra langtur,». Bokstavene er leselige på bildet, men i den maskinleste teksten er «fra» blitt «ira». For dette uriktige ordet har programmet lagret en sikkerhetsskår på 0,91 av 1. Boksiden og OCR-filen.
Olaf Benneche, Tordenskjold (1929), s. 5. Nasjonalbibliotekets bokbilde har «fra», mens den tilhørende OCR-filen har «ira». Skåren er OCR-programmets eget anslag.
Forskerne som bygde NB-BERT, begynte med en eksisterende flerspråklig BERT-modell og trente den videre på et materiale hvor bøkene utgjorde den største delen. Da de deretter tilpasset den til å gjenkjenne navn, gjorde den det bedre enn den flerspråklige modellen i testene på bokmål og nynorsk.
En sentral del av BERT-treningen består i å skjule tekstbiter og la modellen beregne hva som sto der. Det kan være hele ord eller deler av ord, og modellen får bruke teksten på begge sider av hullet til å finne svaret. Forslaget sammenlignes så med den opprinnelige teksten, og forskjellen brukes til å justere tallene som styrer beregningen. Bøkene leverer dermed svarene modellen skal lære å finne. Oppgaven er å fylle inn noe som mangler i en tekst den ellers får se, ikke å skrive en fortsettelse på en samtale.
Er den maskinleste teksten feil, kan feilen bli stående som svaret treningen retter seg etter. Derfor har rettelsene betydning lenge etter at noen har funnet igjen boken: De endrer eksemplene den neste modellen lærer av.
Bokbildene fantes fortsatt. Da bibliotekets forskere laget Norwegian Colossal Corpus, NCC, som ble publisert i 2022, kjørte de bøker skannet før 2009 gjennom nyere tekstgjenkjenning og filtrerte deretter bort tekst med lav sikkerhetsskår. De gikk tilbake til det som allerede var bevart, for å få mer brukbar tekst ut av det.
Et korpus er en samlet mengde tekst som kan brukes til språkarbeid. NCC omfattet over sju milliarder ord fra blant annet bøker, aviser og offentlige dokumenter, og var en annen samling enn treningsmaterialet til NB-BERT. Her fulgte opplysninger om dokumenttype, utgivelsesår og anslått språk med teksten, slik at andre kunne velge ut det de trengte til sitt arbeid.
Vil en utvikler finne nynorsken eller skille eldre tekst fra nyere, gir disse opplysningene noe å lete etter. Materialet kan undersøkes og settes sammen på nytt før modellen trenes. Samler vi i stedet alle ordene i én stor fil og fjerner forbindelsen til opphavet, gir vi fra oss den muligheten.
Men opplysninger om språket hjelper lite hvis bokstavene er feil. Da forskere arbeidet med samiske tekster fra samlingen, var erstatning av «ï» med «i» blant de vanligste feillesningene. De rettet tekst fra de skannede sidene for hånd og brukte rettelsene til å trene bedre gjenkjenning. Deretter rettet de de nye modellresultatene igjen. Menneskene og programmene gjorde vekselvis mer av materialet brukbart.
For skoltesamisk ble det for vanskelig. Språket har tre ulike apostroftegn med betydning for uttalen, og uten tilstrekkelige språkkunnskaper kunne ikke forskerne transkribere dem pålitelig. Skoltesamisk ble utelatt; arbeidet gikk videre med fire andre samiske språk. Flere boksider i en mappe ville ikke ha løst dette. Noen måtte kunne avgjøre hva som faktisk sto på dem.
På Stortinget finnes et annet materiale: opptak av talene og referater av det som ble sagt. Forskerne som laget Stortinget Speech Corpus, SSC, måtte koble korte lydutdrag til riktig sted i referatene. Først lot de eksisterende talegjenkjennere skrive ut hvert utdrag på bokmål og nynorsk. Maskintekstene ga dem noe å lete med, slik at de kunne finne igjen passasjen i referatet og sette sammen par av lyd og tekst til ny trening.
Referatene var allerede bearbeidet av mennesker, som kunne ha fjernet nøling og gjentakelser. Bruker vi dem som svar i treningen, ber vi modellen lage bearbeidet skrift av talen. En utskrift av hvert eneste ord ville gitt et annet treningsgrunnlag. Valget er gjort før modellen begynner å lære.
Dette materialet inngikk senere i NB-Whisper, hvor forskerne trente videre på eksisterende Whisper-modeller med lyd og tilhørende tekst fra blant annet Stortinget, NRK og lydbøker. Etter den første treningsrunden satte de modellene til å lete etter dårlige treningspar. Hvis modellforslagene tydet på at referatteksten hadde fått tillegg eller manglet noe som var sagt, kunne utdraget bli fjernet. De beholdt referatene som treningssvar fremfor å erstatte dem med modellforslagene, og brukte NB-BERT til å finne navn som kunne være føyd til i referatet uten å ha blitt sagt.
Da de trente på nytt, var materialet blitt et annet og langt mindre. SSC hadde bidratt med 2 230 timer i første runde. I den andre var det 523 igjen.
Oppryddingen kunne også fjerne verdifulle data. Modellene som ble satt til å kontrollere materialet, trakk ingen sikker grense mellom det brukbare og det feilaktige.
Når referatet og modellforslaget er uenige, kan det være referatet som avviker fra talen. Men det kan også være kontrollmodellen som svikter.
Boksidene og taleopptakene ligger der fortsatt, også de som ikke kom gjennom rensingen. En bedre gjenkjenner kan gjøre det mulig å bruke tekster og stemmer som tidligere ble sortert bort. Da kan neste modell få et rikere norsk materiale uten at biblioteket først må finne en eneste ny bok.