1. april 2023 ba en føderal dommer i New York om kopier av åtte rettsavgjørelser. De var allerede sitert i et dokument advokat Peter LoDuca hadde levert til retten. Henvisningene oppga hvor avgjørelsene skulle være publisert. Likevel hadde verken motpartens advokater eller retten klart å finne flere av dem.

To uker senere leverte LoDuca dokumentene. Ett av dem het Varghese v. China Southern Airlines. Det hadde saksnummer, navn på tre dommere og avsnitt med juridiske drøftelser, slik en avgjørelse fra retten skulle ha. Men da domstolen som angivelig hadde avsagt den, ble kontaktet, bekreftet den at dokumentet ikke var ekte. Saksnummeret tilhørte en annen sak.

Striden hadde begynt med en serveringsvogn. Roberto Mata hevdet at en metallvogn hadde truffet venstre kne hans på en flyreise fra El Salvador til New York. Han saksøkte flyselskapet Avianca. Selskapet svarte at kravet var reist for sent.

Steven Schwartz, LoDucas kollega, lette etter avgjørelser som kunne støtte at fristen hadde sluttet å løpe mens Avianca var under konkursbehandling. Senere forklarte han at firmaets søketjeneste ga ham utilstrekkelig tilgang til føderale saker. ChatGPT hadde han hørt om. Han oppfattet det som en avansert søkemotor, og ba om argumenter for at konkursen påvirket fristen. Deretter ville han ha konkrete avgjørelser som støttet argumentet. Samtaleutdragene viser hvordan tjenesten fulgte ham videre: Ba han om flere saker, kom flere navn og henvisninger. Ba han om selve avgjørelsene, fikk han det ChatGPT omtalte som utdrag.

Schwartz skrev innlegget, og LoDuca leverte det 1. mars etter å ha lest gjennom språk og flyt. Avgjørelsene undersøkte han ikke. Han hadde kjent Schwartz i mer enn 25 år og stolte på arbeidet hans. To uker senere, 15. mars, meldte Aviancas advokater fra om at de ikke fant de fleste sakene. De få de fant, støttet ikke påstandene de var brukt til.

Her kunne de to advokatene ha stanset. LoDuca videresendte imidlertid motpartens innlegg uten først å lese det. Schwartz leste det, men sa senere at han fortsatt hadde trodd at ChatGPT måtte ha funnet sakene et sted. Kanskje de ikke var publisert. Kanskje tilgangen var vanskelig.

Ingen av dem trakk innlegget tilbake. Så ba dommeren om kopiene.

Kopiene som kom 25. april, ga retten mer å undersøke. I den påståtte Varghese-avgjørelsen begynte saken med et dødsfall og et søksmål fra Susan Varghese. Lenger nede var det blitt en sak om Anish Varghese, nektet ombordstigning på grunn av overbooking. Teksten skiftet mellom ulike former for konkursbehandling uten å forklare hvorfor, og tok slutt uten noen konklusjon. Selv partene og hendelsen som skulle avgjøres, holdt ikke sammen gjennom dokumentet.

Saksnummer 18-13694 tilhørte George Cornea v. U.S. Attorney General. Det fantes altså, men førte til andre parter. Retten fant også ekte navn og henvisninger inni den falske teksten, og noen ledet til avgjørelser som verken inneholdt sitatene eller støttet argumentene de var tillagt. Å finne igjen et navn var derfor bare begynnelsen på kontrollen. Domstolen eller årstallet kunne være feil, og ordene som ble lagt i dommerens munn, kunne mangle i en ellers virkelig avgjørelse. Andre henvisninger var oppdiktet helt fra starten.

Schwartz hadde fått tekst med de kjennetegnene han ventet å finne i en dom, og behandlet den som om den var hentet fra en domstol. En språkmodell av GPT-typen lager tekst ved å beregne sannsynligheter for neste tekstbit ut fra det som allerede står der. Under treningen justeres modellens tall etter teksteksempler, slik at resultatet kan romme kunnskap om verden og mønstre i hvordan bestemte dokumenter skrives. Det gir grunnlag for å sette et saksnavn, et årstall og en juridisk formulering inn i en språklig sammenheng. Ingen avgjørelse trenger å ha blitt hentet fra et arkiv for at teksten skal få denne formen.

Hvilke treningstekster eller interne beregninger som lå bak akkurat navnene og tallene i Varghese, får vi ikke vite av rettsdokumentene. Der kan vi følge spørsmålene, svarene og advokatenes bruk av dem.

Også bekreftelsen ble skrevet

Da Schwartz til slutt la frem sin egen erklæring, fulgte skjermbilder fra ChatGPT med. På ett av dem spurte han om Varghese var en virkelig sak. Ja, svarte tjenesten, og gjentok saksnavnet, henvisningen og året. Han spurte også hva kilden var. Et annet svar beklaget tidligere forvirring, sa at saken var dobbeltsjekket og forsikret at den fantes i Westlaw og LexisNexis, to juridiske databaser. På spørsmålet om de andre sakene var falske, svarte ChatGPT at også disse var virkelige.

Ingen kopi fra databasene fulgte med disse forsikringene. Westlaw og LexisNexis var navn i et nytt svar fra den samme tjenesten som hadde levert avgjørelsene. Nå måtte også den påståtte kontrollen kontrolleres.

Den oppdiktede avgjørelsen og ChatGPTs forsikring, sammenholdt med rettens kontroll. P. Kevin Castel, 22. juni 2023.

Mata v. Avianca, dokument 54, s. 10–11 og 42

Tidspunktet for disse spørsmålene ble også omstridt. Erklæringen Schwartz leverte 25. mai, oppga ingen dato for samtalen, og dommer P. Kevin Castel mente fremstillingen ga inntrykk av at bekreftelsene hadde kommet før ett av de to innleggene til retten. I en ny erklæring 6. juni skrev Schwartz at han hadde spurt etter at retten 4. mai krevde en forklaring på de falske avgjørelsene. ChatGPTs forsikringer skulle nå ha bekreftet mistanken hans om at tjenesten ga uriktige svar.

Castel beskrev forklaringene som skiftende og motstridende. Vi har svarene og de ulike forklaringene på hva Schwartz mente de betydde, men ikke grunnlag for å plassere denne bekreftelsen før innleveringen 1. mars.

For å få tak i en avgjørelse må det faktisk gjøres et oppslag. En språkmodell kan kobles til et slikt dokumentsøk. Patrick Lewis og kolleger beskrev i 2020 en metode de kalte retrieval-augmented generation, vanligvis forkortet RAG. Systemet hentet tekstutdrag fra en samling og brukte dem sammen med spørsmålet når det genererte svar. Dermed kunne den som kontrollerte svaret, også undersøke teksten som var hentet.

Det gjenstår arbeid etter et slikt søk. Dokumentet kan være feil, eller modellen kan skrive noe dokumentet ikke støtter. Selv en lenke til den riktige dommen avgjør ikke om et bestemt sitat står der; det må leses og sammenholdes med svaret. Men da har vi et dokument å gjøre dette med. ChatGPTs forsikring om at Varghese lå i Westlaw, hadde bare gitt Schwartz flere ord fra ChatGPT.

  1. juni påla Castel de to advokatene og firmaet å betale til sammen 5000 dollar til retten. Han la vekt på at de hadde opprettholdt de falske henvisningene etter at motparten og retten hadde utfordret dem, og på uriktige og villedende forklaringer underveis. Han fant at advokatene hadde handlet i ond tro. Samtidig skrev han at de hadde uttrykt oppriktig anger, og at de falske avgjørelsene ikke var levert for personlig økonomisk vinning.

Den oppdiktede Varghese-avgjørelsen kan nå finnes i rettens saksdokumenter. Castel la den ved sin egen avgjørelse som dokumentasjon på hva som var levert. Over sidene står et stort vannmerke: «DO NOT CITE OR QUOTE AS LEGAL AUTHORITY».