Forsterkningslæring i praksis: agenten trekker fargelapper og lærer seg veien i labyrinten, helt uten forklaringer.
60 min5.–10. trinn og VGSGrupperUnplugged
Kjernepoeng
Elevene spiller et labyrintspill der én elev er «agent» som finner veien ved å trekke tilfeldige fargelapper ved hvert veivalg — ikke ved å tenke seg fram. Lappene fjernes ved feil og legges til ved seier, og styrer dermed sjansen for hver retning i neste runde. Elevene ser en strategi vokse fram fysisk, runde for runde. Forsterkningslæring er mekanismen bak maskinen AlphaGo og den fininnstillingen av ChatGPT som kalles RLHF.
Labyrint-ark: 1 side · ferdig oppsatt 5×5-labyrint med fargekodede veikryss og fordelingsoversikt for lappene · skriv ut 1 per par
Sjekk det du har lært: 2 sider · skriv ut 1 ark per elev
Fargelapper eller sjokoladepenger i fire farger (blå, gul, rød, grønn) — 20 stk til standardlabyrinten, per par
Liten skål eller pose per veikryss til lappene (valgfritt, men gjør trekkingen roligere)
Bind for øynene (valgfritt) — sikrer at agenten trekker helt blindt
Forberedelse: Sett opp fargelappene ved hvert nummererte veikryss på labyrint-arket, etter fordelingsoversikten som står nederst på arket selv (20 lapper til sammen for standardlabyrinten). Gjennomfør ett par forsøk selv på forhånd, så du kjenner rytmen i «trekk lapp → flytt → registrer utfall», før elevene overtar.
Forsterkningslæring · GjennomføringSide 2
Les til klassen
«Dere er et KI-team som skal lære opp en robot til å navigere et lager. Roboten vet ingenting — den kan ikke se kart, og ingen forklarer reglene. Den eneste informasjonen den får er: 'bra' eller 'dårlig' etter hvert trekk. Oppdraget: la roboten lære seg veien på egenhånd.»
Tips: Spør klassen: «Hvordan vil dere lære en robot noe hvis den ikke kan læse eller snakke?» Ta imot alle svar uten å vurdere dem. Fortell at i dag skal de selv være både robot og lærer, og finne svaret gjennom et spill.
1
0–10 min
Introduksjon — fem nøkkelbegreper
Vis: NØKKELBEGREPER
Forklar kort fem begreper før spillet starter:
Agent: roboten — eleven som trekker fargelapper
Miljø: labyrinten, veikryssene og fargelapp-bunkene
Tilstand: hvilket veikryss agenten er ved nå
Handling: å trekke en lapp blindt — fargen bestemmer retningen
Belønning: mål → legg til en lapp av vinnerfargen ved hvert kryss på veien. Blindvei → fjern lappen som ble trukket ved det siste krysset
💡 Eksempel: AlphaGo lærer å spille Go gjennom belønning — hver seier styrker trekkene som ledet dit. Over millioner av spill blir de beste trekkene mer og mer sannsynlige, akkurat som fargelappene i dag. Vil du forklare hva en Q-tabell egentlig er? Se side 4 — «Lærerens hjørne».
2
10–30 min
Runde 1 — agenten trekker blindt
Vis: RUNDE 1
Hva elevene gjør: Elevparet starter med labyrint-arket foran seg. En er agent (lukker øynene ved hvert nummererte kryss). En er miljø (holder styr på bunkene og flytter roboten). Målet er å spille så mange enkeltspill som mulig — ikke bare ett langt forsøk.
Ett spill:
Agent starter i S. Utenfor kryssene beveger den seg automatisk framover — ingen trekning der
Ved kryss ①–④: trekk én tilfeldig lapp fra bunken der. Fargen bestemmer retningen — miljø flytter roboten dit
Havner agenten i en rosa rute (×)? Spillet er over — miljø fjerner lappen som ble trukket ved det siste krysset
Når agenten når G eller en blindvei: start umiddelbart et nytt spill fra S. Gjenta i 20 minutter — det blir gjerne 8–12 spill
💡 Vandring: Spør: «Hvorfor blir noen bunker tynnere enn andre? Hvilket kryss stopper dere oftest ved?» La dem oppdage selv, ikke forklar.
Forsterkningslæring · Gjennomføring, forts.Side 3
3
30–45 min
Runde 2 — lappene styrer mot målet
Vis: RUNDE 2
Hva elevene gjør: Fortsett å spille akkurat samme spill som i Runde 1 — bunkene ved hvert kryss er nå skjeve etter alle spillene i Runde 1, så det trengs ingen ny forklaring.
Samme prosedyre, spill etter spill — men sjansen for et godt trekk er høyere, fordi dårlige lapper allerede er fjernet noen steder
Fortsett å oppdatere bunkene etter hvert spill, akkurat som i Runde 1 — de blir enda skjevere for hvert spill
Sammenlign: hvor mange av spillene endte med seier i Runde 1? Og i Runde 2?
Endte agenten i samme blindvei flere ganger på rad? Hvorfor blir ikke sjansen for det null med én gang?
💡 Hvis tid: Tell hvor mange spill på rad som slutter i seier mot slutten av runden — se om bunkene ved kryss ①–④ er nesten rene i vinnerfargen.
4
45–60 min
Diskusjon — AlphaGo, RLHF, etikk
Vis: REFLEKSJON
Samle klassen. Fargelappene er strategien, og elevene så den bli tydeligere fra runde til runde — ikke fordi noen forklarte, men fordi de opplevde det.
Spørsmål til klassen
Agenten lærte ikke av forklaringer — bare av belønning og straff. Er det en god måte å lære på? Hva er fordelen, hva er risikoen?
Hva om reglene for lappene var annerledes — f.eks. fem nye lapper per seier i stedet for én? Raskere læring, eller for forsiktig en strategi?
ChatGPT ble finjustert gjennom RLHF — mennesker sa hva som var «gode» og «dårlige» svar. Hva hvis de menneskene hadde partiske synspunkter?
Autonome kjøretøy lærer gjennom «belønning» (sikker kjøring) og «straff» (ulykker). Hvem bør bestemme prioriteringen — og hvem bør «belønnes» i et vanskelig valg?
Koble til virkeligheten
AlphaGo / AlphaZero: spilte millioner av partier, belønnet for seiere.
ChatGPT (RLHF): finjustert med menneskers preferanser som belønningssignal.
Selvkjørende biler: lærer sikker kjøring gjennom simulering og belønning.
Forsterkningslæring · Lærerens hjørneSide 4
Bakgrunnsstoff og faglig forankring
Dette hjørnet er kun for deg — bakgrunn, differensiering og begrepene du trenger å være trygg på før du går inn i klasserommet.
Hvorfor denne aktiviteten?
Forsterkningslæring driver noe av den kraftigste KI-en som finnes — fra roboter til go-motorer til språkmodeller. Denne aktiviteten gjør prinsippet fysisk: fargelappene ved hvert veikryss er Q-tabellen, ikke et tall på et ark. Elevene ser bunkene skjeve seg mot det som fungerte, runde for runde — uten at noen forklarer hvorfor.
Differensiering
5.–7. trinn: Bruk labyrint-arket som det er, og spill selv miljø-rollen i det aller første spillet som modell før elevene overtar.
8.–10. trinn og VGS: Labyrint-arket fungerer for alle trinn. Vil klassen ha en større utfordring, kan dere tegne en egen, større labyrint med samme fargelegende (opp=blå, ned=gul, venstre=rød, høyre=grønn) og flere veikryss.
Rask gruppe / VGS: Gå videre til «For VGS»-utvidelsen under Slå opp ved behov — bytt ut fargelappene med tall og regn ekte Q-verdier.
Faglig kobling (LK20)
Naturfag: Bruke og vurdere digitale ressurser og modeller til å utforske fenomener og forstå prinsipper for teknologiske systemer.
Matematikk: Utforske og beskrive strukturer og mønstre, anvende funksjoner og modeller.
Programmering og IT: Forstå grunnleggende prinsipper i algoritmisk tenking og hvordan systemer lærer fra data.
Samfunnsfag: Drøfte konsekvenser av digitalisering, kunstig intelligens og automatisering, samt etikk og ansvar i teknologibruk.
Begreper i dette opplegget
Begrep
Enkel forklaring for klasserommet
Forsterkningslæring (RL)
Maskinlæringsmetode der en agent lærer gjennom å ta handlinger, motta belønning eller straff, og gradvis bygge opp en strategi.
Agent
Enheten som lærer og tar beslutninger — kan være en datamaskin, robot eller algoritme.
Miljø
Verden eller systemet som agenten opererer i — gir tilbakemeldinger basert på agentens handlinger.
Tilstand (State)
Nåværende situasjon for agenten — for eksempel posisjonen i labyrinten eller brikkeoppstillingen i et spill.
Handling (Action)
Hva agenten gjør — for eksempel gå opp, ned, venstre eller høyre i labyrinten.
Belønning (Reward)
Numerisk verdi som miljøet gir agenten — positiv for ønskede handlinger, negativ for uønskede, null for nøytrale.
Q-tabell
Tabell som viser forventet belønning for hver (tilstand, handling)-kombinasjon. Brukes av agenten til å ta bedre beslutninger over tid.
Policy
Agentens strategi — reglene for hvilken handling som velges i hvilken tilstand for å maksimere belønning.
RLHF
Reinforcement Learning with Human Feedback — metoden der menneskers preferanser brukes som belønningssignal til å finjustere KI-modeller som ChatGPT.