1. Koble begrepet til riktig forklaring. Trekk en linje fra begrepet til definisjonen som passer.
2. Kryss av riktig påstand.
3. Fyll inn. Fullfør setningene med riktig begrep.
| En __________ er enheten som lærer fra belønning og straff. |
| Når agenten tar en handling, mottar den __________ som tilbakemelding. |
| ChatGPT ble finjustert ved hjelp av __________ (RLHF) — menneskers preferanser som belønningssignal. |
4. Beskriv hva som skjedde i Runde 1. Hvordan forsøkte agenten å finne veien før den hadde erfaring?
5. Hva ble bedre i Runde 2? Hvordan brukte agenten Q-tabellen? Gikk det raskere eller saktere enn Runde 1?
6. Sammenhengen. Hva ville skjedd hvis reglene for fargelappene var annerledes — for eksempel hvis hver seier ga fem nye lapper i vinnerfargen i stedet for én?
AlphaGo spilte millioner av partier mot seg selv. Hver seier var +belønning, hvert tap −belønning. Etter det lærte det å spille bedre enn noe menneske.
Hva tror dere AlphaGo opplevde gjennom belønningen? Hva hvis belønningen hadde vært annerledes — for eksempel hvis agenten fikk −belønning for å vinne?