Den svarte steinen havner på femte linje fra kanten. Den tar ingen hvite steiner og lukker ikke noe område. Foreløpig ligger den bare der, diagonalt inntil steinen Lee Sedol nettopp har lagt på høyre side av brettet.

Det er 10. mars 2016 i Seoul. AlphaGo har vunnet det første partiet mot Lee, som har 18 internasjonale titler bak seg. Nå spiller dataprogrammet med svart, og dets nittende stein blir partiets trekk nummer 37. Punktet heter P10. På opptaket fra kampen blir steinen også satt opp på kommentatorenes demonstrasjonsbrett. Den er lett å overse blant de andre.

Svart: AlphaGo. Hvit: Lee Sedol. Utsnitt av stillingen før og etter trekk 37.

Kampopptaket, trekk 37

For en Go-spiller er det avstanden til kanten som får trekket til å skille seg ut.

Go spilles ved at motstanderne vekselvis legger svarte og hvite steiner på kryssene i et rutenett. En stein blir liggende der den er satt, med mindre den blir omringet og fanget. Kampen står om området på brettet, og her gjør kanten en del av arbeidet for deg: Du trenger ingen steiner til å stenge veien der brettet slutter. Ute i midten må avgrensningen bygges på alle sider.

Likevel kan en stein lenger inne være nyttig. Den kan hjelpe andre steiner, begrense motstanderens muligheter og få verdi i en kamp som ennå ikke har oppstått. Dette kaller Go-spillere innflytelse. Problemet er å sette en verdi på den mens store deler av brettet fortsatt er åpent. Et område du allerede har sikret, lar seg telle. Fremtidig hjelp er det verre med.

Det er denne handelen AlphaGo nå tilbyr Lee. Den hvite steinen ligger på fjerde linje; den svarte settes ett steg lenger inn, skrått ved siden av. Et slikt skuldertrekk ville vanligvis gi hvit for gode muligheter til å bygge område langs siden, vurderer den profesjonelle spilleren Antti Törmänen i sin analyse. Svart ville sitte igjen med innflytelse i midten som var mindre verdt. Det oppsiktsvekkende ved trekk 37 var altså ikke at programmet hadde funnet på å legge en stein ved siden av en annen. Det valgte denne byttehandelen på femte linje.

Men brettet er ikke tomt. AlphaGo har allerede svarte steiner langs undersiden, og i analysen Fan Hui utarbeidet med Gu Li og Zhou Ruiyang, er det forbindelsen mellom dem og det nye trekket som gir P10 mening. Lee kan få mer område til høyre, mens AlphaGo bygger muligheter innover. Løsriver vi steinen fra resten av stillingen, mister vi nettopp det som gjør det mulig å forstå valget.

Kamp 2 i Seoul, 10. mars 2016. Stillingen etter trekk 37, med de tre svarte steinene K4, N4 og P4 markert langs undersiden.

Partinotasjon: Fan Hui mfl.

Lee svarer med en hvit stein rett over den svarte. AlphaGo forlenger mot venstre, inn mot midten, før Lee legger en stein enda litt lenger inn. Nå er P10 blitt enden av to svarte steiner på rad, med hvite steiner over dem. Ingen har overtatt hele midten. De har begynt å forme det de skal kjempe om.

For AlphaGo måtte vurderingen komme før disse steinene lå der. Det hjelper jo lite å se en god fortsettelse når motstanderen allerede har gjort den umulig.

Å prøve alle mulige trekk og alle svarene på dem ville ikke fungere. Hvert svar åpner nye valg, som igjen åpner nye valg, og fra denne tidlige stillingen blir antallet mulige partiforløp uhåndterlig. Programmet trengte derfor hjelp til to ting: å velge hvilke fortsettelser det var verdt å undersøke, og å vurdere en stilling før partiet var ferdig.

Forskerne begynte hos menneskene. De trente et nevralt nettverk, en beregning med mange justerbare tall, til å forutsi hvilket trekk en sterk spiller ville velge i en gitt stilling. Når tallene ble justert, ble forslagene mer lik trekkene i materialet. Deretter lot de en videreutviklet versjon spille mot tidligere versjoner av seg selv. Nå var det resultatet av partiet som skulle gjøre den bedre: seier eller tap. Dette er forsterkningslæring. Selvspillet ga dessuten stillinger og sluttresultater som kunne brukes til å trene et nettverk til å vurdere vinnersjanser.

Dermed hadde programmet lært noe det kunne bruke ved brettet. Men treningen hadde ikke på forhånd valgt trekket i stillingen som nettopp var oppstått. Det var søkets arbeid.

I systembeskrivelsen forskerne publiserte i januar 2016, begynte søket med sannsynlighetene fra et policy-nettverk, trent på mennesketrekk. De ga programmet et utgangspunkt for hvilke grener av trekk og svar det skulle prøve. Et verdinettverk anslo utfallet fra stillingene søket nådde, mens en enklere og raskere beregning spilte andre fortsettelser helt ut. Resultatene kom tilbake til søket og påvirket hvilke grener det undersøkte flere ganger. Det var også satt av rom til mindre prøvde alternativer. Til slutt valgte programmet trekket som var prøvd flest ganger fra utgangsstillingen.

Det første forslaget var altså ikke en ordre. Et sannsynlig mennesketrekk og et godt konkurransetrekk kunne være forskjellige ting, og søket ga programmet en måte å arbeide videre med forskjellen på.

Januarartikkelen beskriver forløperen til programmet som møtte Lee i mars. Den inneholder ingen logg over fortsettelsene AlphaGo undersøkte før P10. Vi kan følge steinene som ble lagt. Den fullstendige begrunnelsen for trekk 37 får vi ikke ut av dem.

Og partiet var slett ikke vunnet da den svarte steinen kom på plass. Etter noen få trekk til forlater AlphaGo høyresiden og spiller på undersiden. Snart følger en kamp til venstre, og Fan Huis kommentar peker på senere feil hos svart og en mulighet for Lee til å overta initiativet. Først ved trekk 211 gir Lee opp.

Seieren krevde en lang rekke valg. Trekk 37 står igjen fordi det gjorde en uvant vurdering synlig: Område langs kanten kunne være en akseptabel pris for muligheter lenger inne.

Året etter flyttet forskerne treningen enda et stykke bort fra menneskenes eksempler. AlphaGo Zero begynte uten menneskelige partier som treningsmateriale. Nettverket lærte gjennom selvspill, av trekkene søket valgte og av hvem som vant. Så ble det forbedrede nettverket brukt i nye søk og nye partier, som igjen ga materiale å lære av. I den publiserte testen slo Zero versjonen som hadde møtt Lee, med 100 seire mot null tap. Menneskene hadde fortsatt laget reglene og systemet. Partiene trengte de ikke lenger å levere.

På Go-brettet finnes det et klart svar å lære av. Begge siders steiner er synlige, reglene bestemmer hva som er lovlig, og et prøveparti kan spilles helt ferdig. Dermed kan programmet tape tusenvis av treningspartier og bruke tapene til å gjøre neste versjon bedre. Det som må finnes underveis, er veien til et mål som allerede er gitt.

Den svarte steinen på P10 flyttet seg aldri. Verdien dens avhang av alt som ble lagt rundt den.