← Arkivet
Avsnitt #47·

#ensakidag 47 – Google NLP gör gamla texter som nya

AI-genererat · ej JJ-verifierat

Faktaruta, 2026-update, Bedömning och Guldkorn är AI-genererad redaktionell kommentar - skild från JJ:s eget avsnitt.

Lyssna / seSpotifyLjud

Beskrivning · den här hjälpte jag AI att skriva // JJ

Det finns arkiv som sover. Hundra år av lokaljournalistik, ord för ord, bild för bild, och allt vi har gjort med dem är att sälja faksimil till folk på födelsedagen. Det, säger JJ, är att misshushålla med data. Och i natt släppte Google verktygen som kan väcka dem.

Två nya funktioner på Googles Cloud-plattform, ännu i beta: en som klassificerar text i ungefär 700 kategorier (en och samma artikel kan vara sport, teknik och mat på en gång), och en som läser känsla, inte i hela meningen utan ord för ord. JJ tar sitt eget exempel: ”Försenad till jobbet igen. Tack för det, Skånetrafiken. Men vilken tur att jag kan jobba ändå. Tack för det, Apple.” Den gamla tekniken vet inte vad den ska tro. Den nya förstår att du är sur på det ena och tacksam mot det andra. Det är ingen liten skillnad.

Och det är här det blir stort. Ta Helsingborgs Dagblads arkiv: hundra år bakåt, aldrig strukturerat. Kör det genom den här tekniken och plötsligt har du klassificerade artiklar, kartlagda känslor, platser och människor länkade till varandra. Lägg till Google Vision, som gör samma sak med bilderna, och ett sekel av fotografier blir sökbart bakgrundsmaterial till morgondagens rubriker. Ett dött arkiv blir ett levande minne.

Sedan kommer brasklappen, och den svider: det funkar inte på svenska. Engelska, spanska, kinesiska, arabiska, javisst. Men inte vårt språk. ”Är inte det deppigt?”

Transkript · JJ:s egna ord

Faktaruta

AI-kommentarAI-genererat · ej JJ-verifierat
Företag / produkt
Google Cloud Natural Language API – textklassificering och sentimentanalys på entitetsnivå. Google Cloud Vision API – bildklassificering. Båda lanserade i beta september 2017.
Teknik
Natural Language Processing (NLP): (1) Innehållsklassificering mot ~700 kategorier. (2) Entitetsbaserad sentimentanalys – positiv/negativ per specifikt omnämnt objekt snarare än per mening. Vision API: bildtolkning och klassificering. Video Intelligence API: videoanalys.
Tidslinje
  • September 2017: Google Cloud NLP-API lanseras i beta med klassificering och entitets-sentiment. Saknar svenska.
  • 2017–2022: API:et expanderar med fler språk och kategorier
  • 2023: Google lanserar Vertex AI och integrerar NLP-funktioner i bredare AI-plattform
  • 2026: Google Cloud Natural Language API stödjer fortfarande INTE svenska i klassificering eller sentimentanalys – engelska, spanska, franska, tyska, japanska, kinesiska, koreanska och portugisiska är de primära språken. NLP v2-modell (Public Preview) stöder 1 091 kategorier och 11 språk – svenska fortfarande ej inkluderat.

2026 - vad vet vi nu

AI-kommentarAI-genererat · ej JJ-verifierat

JJ:s vision om att historiska textarkiv kan bearbetas automatiskt med NLP har blivit mer sann än han troligen anade – men för publicister i Sverige med ett bitterljuvt tillägg: svenska stöds fortfarande inte i Google Cloud NLP:s klassificerings- och sentimentanalys 2026. JJ:s frustration i slutet av avsnittet – 'det funkar naturligtvis inte på svenska' – är alltså fortfarande giltig nio år senare. Däremot har GPT-4, Claude och lokala LLM-modeller som KBLab:s svenska BERT löst mycket av NLP-behovet på svenska på helt andra sätt. Visionen om att privatpersoner ska kunna bearbeta sina gamla semesterbilder och texter är verklighet 2026 via Google Photos, Apple Intelligence och ChatGPT – dock inte via det API JJ refererade till. Prismodellen ('ungefär en krona per miljon tecken') är i sak fortfarande i rätt storleksordning för enkla API-anrop.

Bedömning

AI-kommentarAI-genererat · ej JJ-verifierat

Träffsäkerhet

4/5

Tidlöshet

4/5

Historiskt värde

5/5
Källa-verifierad

Hårda påståenden i facit har stämts av mot källor.

JJ förutspår implicit att svenska snart tillkommer. Det har inte skett i Google Cloud NLP. Däremot kom lösningen på ett helt annat sätt – via stora språkmodeller som hanterar svenska utmärkt, men som JJ i september 2017 inte kunde förutse. Det är inte ett miss utan en historisk begränsning i perspektivet.

Guldkorn

AI-kommentarAI-genererat · ej JJ-verifierat
  • Det pedagogiska trolleri som gör NLP begripligt på fem sekunder – JJ på sitt bästa.

    Försenad till jobbet igen. Tack för det, Skånetrafiken. Men vilken tur att jag kan jobba i alla fall. Tack för det, Apple. Så skulle en sentimentanalys som tittar på hela meningen bli totalt förvirrad. För är jag positiv eller negativ? Medan den här sentimentanalysen som släpps i beta-versionen här nu kan klura ut att jag är i det här fallet negativ till Skånetrafiken och positiv till Apple.
  • Mediebranschen och det missbrukade datakapitalet – en observation som är skarpare 2026 än den var 2017.

    Det enda man egentligen kunde använda det här arkivet till var att man sålde fax-emiler på första sidorna till folk som fyllde år. Och det är ju verkligen att misshushålla med datat.
  • Den äkta frustrationen när tekniken sviker svenska – en fråga som lever vidare 2026.

    Oj, sa jag just det? Shit! Satan! Det funkar inte på svenska. Kan ni fatta? Det funkar på engelska och spanska och kinesiska och arabiska och alla de stora språken. Men det funkar naturligtvis inte på svenska. Är inte det deppigt?

Läs mer som detta

AI-kommentarAI-genererat · ej JJ-verifierat

Läst baklänges

Anders Bjarby har läst om hela arkivet baklänges och gjort varje avsnitt till en byggbar idé - med en ärlig efterhandsläsning och en färdig bygg-prompt.

Ett fristående projekt av Anders Bjarby.