← Arkivet
Avsnitt #400··00:06:44

#ensakidag 400 – Ännu en AI designad för att lura AI – den här gången gäller det text.

AI-genererat · ej JJ-verifierat

Faktaruta, 2026-update, Bedömning och Guldkorn är AI-genererad redaktionell kommentar - skild från JJ:s eget avsnitt.

Lyssna / seSpotifyLjud

Beskrivning · den här hjälpte jag AI att skriva // JJ

Det pågår en ständig kapprustning, AI mot AI, och JJ har följt den länge. Redan i avsnitt 80, ”typ för hundra år sedan”, berättade han om bilder som lurade igenkänningen så att en sköldpadda blev ett gevär. Farligt på riktigt, för samma trick kan få en självkörande bil att läsa en stoppskylt som en hastighetsskylt. Nu har kampen flyttat in i texten.

Ett forskarteam från MIT, Hongkong och Singapore har byggt en algoritm de kallar TextFooler. Den angriper det mest elementära i hur en maskin läser en text: är detta positivt eller negativt? JJ visar med en filmrecension. Byt ”contrived” mot ”engineered” och ”totally” mot ”fully”, och för en människa betyder meningen exakt samma sak. Men för maskinen kastas tolkningen helt om, från negativt till positivt. Två ord, hela skillnaden. Och det är ju inte oskyldigt: tänk samma fel i ett CV, eller i en diagnos.

För att sätta det i perspektiv lånar han en bild av Thomas Bäckdahl. Tänk ett spektrum. I ena änden, det maskiner ser glasklart men vi inte begriper, kanske 90 procent. I andra änden, det vi ser men maskinen missar, kanske en enda procent. Och vad gör vi människor? Vi stirrar på den där procenten, skrattar åt hur korkad maskinen är, och blundar för allt den är vassare än oss på. Facebooks transparensrapporter visar det svart på vitt: över tid hittar maskinerna det en människa skulle missa.

JJ är optimist, som vanligt. Det finns ingen naturlag som säger att vi måste vara smartare än maskinerna, det handlar om träningsdata och om att bli bättre på att läsa sammanhang. Det här är inte ett hot att få panik inför, säger han, utan ett bevis på hur fenomenalt skickliga vi är på att uppfinna nya sätt att utmana oss själva. Kanske är det vår enda riktigt definierande superkraft. Klura på det.

Transkript · JJ:s egna ord

Faktaruta

AI-kommentarAI-genererat · ej JJ-verifierat
Företag / produkt
TextFooler (forskarteam MIT, HK, Singapore); adversarial NLP; Facebook Transparency Reports; Thomas Bäckdahls människa-maskin-diagram
Teknik
Adversariell NLP, sentimentanalys, ordsubstitution för att lura AI-klassificerare, bildigenkänning (adversarial examples)
Tidslinje
  • 2019: TextFooler publiceras av Jin et al.
  • Feb 2020: JJ publicerar avsnitt
  • 2020–2026: TextFooler etableras som benchmark för NLP-robusthetstest; mer sofistikerade attacker (BAE, SemAttack) följer
  • 2025–2026: LLM-ära – prompt injection och jailbreaks är 2020-talets analogi till TextFooler

2026 - vad vet vi nu

AI-kommentarAI-genererat · ej JJ-verifierat

Kapprustningen medel mot motmedel är exakt så som JJ beskriver den, och är 2026 långt mer påtaglig. TextFooler-attacken han demonstrerade (byt två synonymer och kasta om maskinens tolkning) var en föraning om hela det fält av adversariella attacker och jailbreaks som nu omger stora språkmodeller. Avsnittet läses som skrivet igår: byt ”AI” mot ”LLM” så är det en 2026-analys. Thomas Bäckdahls spektrumbild, att vi fnissar åt den enda procent maskinen missar och blundar för allt den är vassare på, sitter ännu bättre nu.

Bedömning

AI-kommentarAI-genererat · ej JJ-verifierat

Träffsäkerhet

5/5

Tidlöshet

5/5

Historiskt värde

4/5
Källa-verifierad

Hårda påståenden i facit har stämts av mot källor.

JJ begränsar sig naturligt till sentiment-analys – utanför 6-minutersformatet finns adversariella attacker mot översättning, QA-system och kodgenerering. Inget egentligt miss.

Guldkorn

AI-kommentarAI-genererat · ej JJ-verifierat
  • JJ:s klargörande om hur vi systemiskt missbedömer AI:s styrkor och svagheter

    Och då tittar vi på den 1% och så säger vi Herregud vad maskinerna är korkade som inte fattar detta. Och så ser vi inte allt det som maskinerna är bättre än oss på att begripa.
  • TextFooler-exemplet – två ord, diametralt omvänt resultat

    Och då ändrar man två ord, man ändrar contrived till engineered och man ändrar totally till fully. Så den låter som att the characters cast in impossibly engineered circumstances are fully estranged from reality. Och för människor så låter de här två meningarna som om de betyder samma sak.

Läs mer som detta

AI-kommentarAI-genererat · ej JJ-verifierat

Läst baklänges

Anders Bjarby har läst om hela arkivet baklänges och gjort varje avsnitt till en byggbar idé - med en ärlig efterhandsläsning och en färdig bygg-prompt.

Ett fristående projekt av Anders Bjarby.