Del 1 — Faktaoppgave

1. Koble begrepet til riktig forklaring. Trekk en linje fra begrepet til definisjonen som passer.

Agent
Tabell som viser forventet belønning for hver handling fra hver tilstand
Forsterkningslæring
Enheten som lærer og tar beslutninger
Belønning
Nåværende situasjon for agenten
Tilstand
Numerisk tilbakemelding etter hver handling — positiv eller negativ
Q-tabell
KI som lærer gjennom belønning og straff

2. Kryss av riktig påstand.


3. Fyll inn. Fullfør setningene med riktig begrep.

En __________ er enheten som lærer fra belønning og straff.
Når agenten tar en handling, mottar den __________ som tilbakemelding.
ChatGPT ble finjustert ved hjelp av __________ (RLHF) — menneskers preferanser som belønningssignal.
Del 2 — Aktivitetsrefleksjon

4. Beskriv hva som skjedde i Runde 1. Hvordan forsøkte agenten å finne veien før den hadde erfaring?

5. Hva ble bedre i Runde 2? Hvordan brukte agenten Q-tabellen? Gikk det raskere eller saktere enn Runde 1?

6. Sammenhengen. Hva ville skjedd hvis reglene for fargelappene var annerledes — for eksempel hvis hver seier ga fem nye lapper i vinnerfargen i stedet for én?


🔍 Del 3 — Tankeoppgave (utfordring)

AlphaGo spilte millioner av partier mot seg selv. Hver seier var +belønning, hvert tap −belønning. Etter det lærte det å spille bedre enn noe menneske.

Hva tror dere AlphaGo opplevde gjennom belønningen? Hva hvis belønningen hadde vært annerledes — for eksempel hvis agenten fikk −belønning for å vinne?