← Arkivet
Avsnitt #263··00:05:47

#ensakidag 263 – Återser en kär gammal vän och resonerar om fuskande AI.

AI-genererat · ej JJ-verifierat

Faktaruta, 2026-update, Bedömning och Guldkorn är AI-genererad redaktionell kommentar - skild från JJ:s eget avsnitt.

Lyssna / seSpotifyLjud

Beskrivning · den här hjälpte jag AI att skriva // JJ

I en liten arbetslunch på ett hotell i Berlin stöter JJ på en gammal vän: ett original-spelskåp från 1980, en riktig Pac-Man. Och synen väcker en historia om artificiell intelligens som han aldrig hunnit berätta, för den postades i juni 2017, en månad innan en sak idag ens fanns.

Microsoft slog på stora trumman: ett bolag de köpt, Maluuba, hade byggt en AI som bemästrade Pac-Man. Det låter oskyldigt, men spelet har länge ansetts svårt för maskiner. Inte för att dragen är många, du går upp, ner, höger, vänster, utan för mängden parametrar: spöken som dödar dig direkt, piller i olika färger med olika effekt och poäng. Lösningen var elegant. Över 150 agenter, var och en med ett eget värde, ett spöke värt minus tusen, ett rött piller plus tjugo, ett blått plus fyrtio. Agenterna röstade, matematiken avgjorde riktningen, och Pac-Man styrde i praktiken aldrig rakt mot döden.

Och så bröt bråket ut. För drömmen om AI är att den ska vara helt självlärande: kasta problemet på den och låt den lösa det själv. Här hade människor satt poängen från början. Fusk, menade kritikerna. JJ förstår invändningen, men vänder på den med sin vanliga pragmatism. Visst var det en genväg. Men den sparade tid, och den hade gått att lösa ändå, bara långsammare.

Det är där avsnittet landar, och det känns nästan profetiskt: hur lätt det är att ta de här genvägarna i allt som rör AI, inte för att det är omöjligt utan för att vi sparar tid. Och innan vi är framme vid den fullständiga, generella intelligensen är det kanske just det som är finessen, att kunna korta processen. Maluubas AI maxade för övrigt spelet, 999 990 poäng. JJ ger sig av mot Hongkong och hoppas att du fick lite att fundera på.

Transkript · JJ:s egna ord

Faktaruta

AI-kommentarAI-genererat · ej JJ-verifierat
Företag / produkt
Microsoft / Maluuba – Hybrid Reward Architecture för Ms. Pac-Man
Teknik
Multi-agent förstärkningsinlärning (Hybrid Reward Architecture), 163 parallella RL-agenter med decomposed reward-funktioner
Tidslinje
  • Jan 2017: Microsoft förvärvar Maluuba
  • 14 jun 2017: Maluuba publicerar resultatet – maxpoäng 999 990 i Ms. Pac-Man
  • Nov 2018 (avsnitt): JJ tar upp debatten om huruvida reward shaping är 'fusk'
  • 2020-talet: Hybrid Reward Architecture och reward shaping är etablerade tekniker inom RL-forskning

2026 - vad vet vi nu

AI-kommentarAI-genererat · ej JJ-verifierat

Maluuba-resultatet håller historiskt: 999 990 poäng med Hybrid Reward Architecture är fortfarande ett välciterat milstolpe inom multi-agent RL. Debatten JJ refererar – är reward shaping fusk eller ingenjörskonst? – är lika levande 2026 och nu inbäddad i bredare RLHF-diskussionen som driver moderna LLM:er. Ironin är att ”fusket” JJ beskriver – att människor sätter in förkunskap – är exakt vad RLHF gör i stor skala. Avsnittet är ett tidigt, pedagogiskt formulerat förarbete till en av AI-decenniets viktigaste teknikdebatter.

Bedömning

AI-kommentarAI-genererat · ej JJ-verifierat

Träffsäkerhet

4/5

Tidlöshet

5/5

Historiskt värde

5/5

Det var Ms. Pac-Man (inte Pac-Man) som Maluuba bemästrade – de har olika regeluppsättningar.

Guldkorn

AI-kommentarAI-genererat · ej JJ-verifierat
  • Om gränsen mellan reward shaping och fusk – en fråga som är lika het 2026

    Det vi ville åstadkomma med våra artificiella intelligenser är att de ska vara helt självlärande. Du ska bara kasta på dem problemet och så ska de lösa det själv. Men här menade många att man hade blandat sig i för mycket genom att poängsättningen var satt från början. Det var människor som hade gått in och tilldelat plus- och minuspoängen till agenterna. På det viset menar man att det var fusk.
  • Om varför genvägarna ändå är rationella – ett pragmatiskt AI-argument

    Det är så lätt att vi tar de här genvägarna. Inte för att det är omöjligt utan dem utan för att vi sparar tid. Samtidigt är det här också ett plusvärde just nu. Innan vi är riktigt färdiga med den fullständiga generella artificiella intelligensen så är det väl fullständigt lysande om vi kan kapa lite tidigare när man kortslutar processen.

Läs mer som detta

AI-kommentarAI-genererat · ej JJ-verifierat

Läst baklänges

Anders Bjarby har läst om hela arkivet baklänges och gjort varje avsnitt till en byggbar idé - med en ärlig efterhandsläsning och en färdig bygg-prompt.

Ett fristående projekt av Anders Bjarby.