#ensakidag 263 – Återser en kär gammal vän och resonerar om fuskande AI.
Faktaruta, 2026-update, Bedömning och Guldkorn är AI-genererad redaktionell kommentar - skild från JJ:s eget avsnitt.
Beskrivning · den här hjälpte jag AI att skriva // JJ
I en liten arbetslunch på ett hotell i Berlin stöter JJ på en gammal vän: ett original-spelskåp från 1980, en riktig Pac-Man. Och synen väcker en historia om artificiell intelligens som han aldrig hunnit berätta, för den postades i juni 2017, en månad innan en sak idag ens fanns.
Microsoft slog på stora trumman: ett bolag de köpt, Maluuba, hade byggt en AI som bemästrade Pac-Man. Det låter oskyldigt, men spelet har länge ansetts svårt för maskiner. Inte för att dragen är många, du går upp, ner, höger, vänster, utan för mängden parametrar: spöken som dödar dig direkt, piller i olika färger med olika effekt och poäng. Lösningen var elegant. Över 150 agenter, var och en med ett eget värde, ett spöke värt minus tusen, ett rött piller plus tjugo, ett blått plus fyrtio. Agenterna röstade, matematiken avgjorde riktningen, och Pac-Man styrde i praktiken aldrig rakt mot döden.
Och så bröt bråket ut. För drömmen om AI är att den ska vara helt självlärande: kasta problemet på den och låt den lösa det själv. Här hade människor satt poängen från början. Fusk, menade kritikerna. JJ förstår invändningen, men vänder på den med sin vanliga pragmatism. Visst var det en genväg. Men den sparade tid, och den hade gått att lösa ändå, bara långsammare.
Det är där avsnittet landar, och det känns nästan profetiskt: hur lätt det är att ta de här genvägarna i allt som rör AI, inte för att det är omöjligt utan för att vi sparar tid. Och innan vi är framme vid den fullständiga, generella intelligensen är det kanske just det som är finessen, att kunna korta processen. Maluubas AI maxade för övrigt spelet, 999 990 poäng. JJ ger sig av mot Hongkong och hoppas att du fick lite att fundera på.
Transkript · JJ:s egna ord
Faktaruta
AI-kommentarAI-genererat · ej JJ-verifierat- Företag / produkt
- Microsoft / Maluuba – Hybrid Reward Architecture för Ms. Pac-Man
- Teknik
- Multi-agent förstärkningsinlärning (Hybrid Reward Architecture), 163 parallella RL-agenter med decomposed reward-funktioner
- Tidslinje
- Jan 2017: Microsoft förvärvar Maluuba
- 14 jun 2017: Maluuba publicerar resultatet – maxpoäng 999 990 i Ms. Pac-Man
- Nov 2018 (avsnitt): JJ tar upp debatten om huruvida reward shaping är 'fusk'
- 2020-talet: Hybrid Reward Architecture och reward shaping är etablerade tekniker inom RL-forskning
2026 - vad vet vi nu
AI-kommentarAI-genererat · ej JJ-verifieratMaluuba-resultatet håller historiskt: 999 990 poäng med Hybrid Reward Architecture är fortfarande ett välciterat milstolpe inom multi-agent RL. Debatten JJ refererar – är reward shaping fusk eller ingenjörskonst? – är lika levande 2026 och nu inbäddad i bredare RLHF-diskussionen som driver moderna LLM:er. Ironin är att ”fusket” JJ beskriver – att människor sätter in förkunskap – är exakt vad RLHF gör i stor skala. Avsnittet är ett tidigt, pedagogiskt formulerat förarbete till en av AI-decenniets viktigaste teknikdebatter.
Bedömning
AI-kommentarAI-genererat · ej JJ-verifieratTräffsäkerhet
Tidlöshet
Historiskt värde
Det var Ms. Pac-Man (inte Pac-Man) som Maluuba bemästrade – de har olika regeluppsättningar.
Guldkorn
AI-kommentarAI-genererat · ej JJ-verifierat”Om gränsen mellan reward shaping och fusk – en fråga som är lika het 2026”
”Det vi ville åstadkomma med våra artificiella intelligenser är att de ska vara helt självlärande. Du ska bara kasta på dem problemet och så ska de lösa det själv. Men här menade många att man hade blandat sig i för mycket genom att poängsättningen var satt från början. Det var människor som hade gått in och tilldelat plus- och minuspoängen till agenterna. På det viset menar man att det var fusk.”
”Om varför genvägarna ändå är rationella – ett pragmatiskt AI-argument”
”Det är så lätt att vi tar de här genvägarna. Inte för att det är omöjligt utan dem utan för att vi sparar tid. Samtidigt är det här också ett plusvärde just nu. Innan vi är riktigt färdiga med den fullständiga generella artificiella intelligensen så är det väl fullständigt lysande om vi kan kapa lite tidigare när man kortslutar processen.”
Läs mer som detta
AI-kommentarAI-genererat · ej JJ-verifierat- #458#ensakidag 458 – Seeing AI tar plats i Microsofts alla produkter
Delar teman: AI & maskininlärning, Microsoft
- #473#ensakidag 473 – AI i nationens intresse: Reflektioner från en toppkonferens
Delar teman: AI & maskininlärning, Microsoft
- #380#ensakidag 380 – Test med 2.300 anställda i Japan visar att 4 dagars arbetsvecka ger 40% högre effektivtet.
Delar temat: Microsoft
- #479#ensakidag 479 – AI i rampljuset under Superbowl: skratt- och gråtfest
Delar teman: AI & maskininlärning, Microsoft
- #61#ensakidag 61 – Microsoft fimpar Windows 10 phone
Delar temat: Microsoft
- #306#ensakidag 306 – Seeing AI är en app för synskadade - som lovar superkrafter åt alla
Delar teman: AI & maskininlärning, Microsoft
Läst baklänges
”Anders Bjarby har läst om hela arkivet baklänges och gjort varje avsnitt till en byggbar idé - med en ärlig efterhandsläsning och en färdig bygg-prompt.”
Ett fristående projekt av Anders Bjarby.