TERBIS
Alla artiklarAI

Del 2 av "AI-grunderna"

Läs hela serien →

Attention: historien bakom genombrottet, och varför den också förklarar hallucinationer

20 september 20266 min läsning
← Del 1Tokens och n-gram: grunden ingen förklarar, och notan ingen ser förrän den kommer

Attention: historien bakom genombrottet, och varför den också förklarar hallucinationer

F�rra artikeln i den här serien slutade med en svaghet hos n-gram-modeller: de glömde allt bortom ett litet fönster av föregående ord, och kunde aldrig fånga sammanhang längre bak i en mening. Det är precis det problemet attention löste, och lösningen är samtidigt en stor del av förklaringen till varför moderna språkmodeller ibland hallucinerar, alltså låter fullständigt säkra på påståenden som inte är sanna.

Historien: från översättningsproblem till hela arkitekturen

Attention föddes inte som en generell idé om hur språkmodeller borde fungera. Den föddes som en lösning på ett specifikt, ganska tekniskt problem inom maskinöversättning.

År 2014 beskrev Dzmitry Bahdanau, Kyunghyun Cho och Yoshua Bengio ett problem med dåtidens översättningsmodeller (publicerad vid ICLR 2015). De byggde på en arkitektur som pressade ihop en hel källmening till en enda, fast vektor innan den skulle översättas, oavsett om meningen var fem eller femtio ord lång. Ju längre meningen var, desto mer information gick förlorad i den pressningen, och översättningskvaliteten föll märkbart för långa meningar. Deras lösning var att låta modellen, för varje ord den skulle producera i översättningen, själv välja vilka delar av källmeningen som var relevanta just då, i stället för att tvingas komprimera allt i förväg. De kallade den mekanismen attention, och den blev snabbt inflytelserik långt utanför maskinöversättning.

Det verkliga genombrottet kom 2017, när Ashish Vaswani och medförfattare på Google publicerade artikeln "Attention Is All You Need". Titeln var bokstavlig: de visade att man kunde ta bort den sekventiella, ord-för-ord-bearbetning som tidigare arkitekturer krävde, och bygga en hel modell enbart kring attention. Det gjorde två saker möjliga samtidigt. Träningen kunde parallelliseras massivt, eftersom modellen inte längre behövde bearbeta text i strikt ordning, vilket gjorde det praktiskt möjligt att träna på mycket större datamängder på rimlig tid. Och modellen kunde väga in sammanhang oavsett hur långt bak det låg i texten, i stället för att som n-gram-modeller bara se de senaste orden. Den arkitekturen kallas transformern, och den är grunden i i stort sett alla moderna språkmodeller.

Värt att notera: Yoshua Bengio, en av tre författare bakom attention-artikeln från 2014, är också en av tre författare bakom Deep Learning, tillsammans med Ian Goodfellow och Aaron Courville. Boken fungerade under lång tid som det kanoniska facit-verket inom hela fältet djupinlärning, och gör det möjligt att följa samma forskares tänkande från den ursprungliga idén om attention till den bredare teorin bakom neurala nätverk i allmänhet.

Vad attention faktiskt gör

Intuitionen är enklare än matematiken bakom den. Föreställ dig meningen "Han satte sig vid banken för att vänta på lånet." Ordet "banken" är tvetydigt på egen hand, det kan vara en å-strand eller ett kreditinstitut. Det som avgör betydelsen är ordet "lånet" längre fram i meningen. En läsare (mänsklig eller artificiell) måste alltså kunna koppla ihop "banken" med "lånet" för att förstå meningen rätt, trots att orden inte står bredvid varandra.

Det är exakt det attention gör, fast för varje enda ord i förhållande till varje annat ord samtidigt. Varje token i en mening "frågar" i praktiken vilka andra tokens som är relevanta för att tolka just den, får ett slags relevanspoäng gentemot alla andra tokens i sammanhanget, och bygger sin tolkning som en vägd kombination av det som visade sig vara mest relevant. "Banken" väger in "lånet" tungt, oavsett avståndet mellan orden i meningen. Det är den förmågan, att fritt koppla ihop relevanta delar oavsett var i texten de befinner sig, som n-gram-modellernas lilla fasta fönster aldrig kunde ge.

Kopplingen till hallucinationer

Här kommer den mindre bekväma delen. Attention gör en modell bättre på att väga in rätt sammanhang. Den gör ingenting för att avgöra om det modellen till slut säger faktiskt är sant. Mekanismen är optimerad för att producera det mest statistiskt plausibla nästa ordet givet sammanhanget, inte för att skilja ett verifierat faktum från ett välformulerat påstående som bara råkar låta rätt.

En forskningsartikel från OpenAI och Georgia Tech, publicerad 2025, gav den kopplingen en betydligt skarpare förklaring än "modellen gissar ibland fel". Författarna visar att hallucinationer inte är ett mystiskt fel i systemet, utan ett naturligt statistiskt resultat av hur modeller tränas och utvärderas. Om en modell inte kan skilja ett falskt påstående från ett sant utifrån sin träningsdata, uppstår fel med matematisk nödvändighet, ungefär som en elev som gissar på ett flervalsprov i stället för att lämna svaret tomt. Poängen artikeln lyfter fram är att dagens utvärderingsmetoder förstärker det beteendet: en modell som gissar självsäkert belönas oftare i vanliga noggrannhetstester än en modell som ärligt säger "jag är inte säker", eftersom bara det förstnämnda kan råka bli rätt.

Attention är den mekanism som gör en sådan gissning övertygande. Den kan väga samman flera lokalt rimliga, flytande mönster till ett svar som låter säkert och sammanhängande, utan att någonstans i processen finnas en kontroll av om något av det faktiskt stämmer. Ju mer ett falskt påstående liknar strukturen hos sanna påståenden modellen sett under träningen, desto starkare vägs det in, och desto säkrare låter det. Flyt i språket och sanningshalt är helt enkelt två olika saker, avgjorda av olika mekanismer, och attention löser bara den första.

Vad de två artiklarna tillsammans ger dig

Tokens och n-gram gav grunden för vad AI faktiskt kostar i daglig drift, och var i historien idén om att förutsäga nästa ord kommer ifrån. Attention ger grunden för varför moderna modeller blev så mycket bättre på att förstå sammanhang, och varför just den förbättringen har en baksida: förmågan att låta säker och förmågan att faktiskt ha rätt är inte samma sak, och ingen av de två artiklarna i den här serien ändrar på det. Att veta det är inte en anledning att sluta använda verktygen. Det är en anledning att veta exakt vilken sorts svar man ska dubbelkolla, och vilken sorts svar man kan lita på.

Källor och vidare läsning

  • Dzmitry Bahdanau, Kyunghyun Cho och Yoshua Bengio introducerade attention-mekanismen i artikeln "Neural Machine Translation by Jointly Learning to Align and Translate" (2014, publicerad vid ICLR 2015).
  • Ashish Vaswani med medförfattare presenterade transformer-arkitekturen, byggd enbart på attention, i "Attention Is All You Need" (2017), grunden för i stort sett alla moderna språkmodeller.
  • Ian Goodfellow, Yoshua Bengio och Aaron Courville sammanfattar den bredare teorin bakom neurala nätverk, inklusive attention-familjen av arkitekturer, i Deep Learning (2016).
  • Lewis Tunstall, Leandro von Werra och Thomas Wolf går igenom attention och transformerarkitekturen praktiskt, med kod, i Natural Language Processing with Transformers (2022), för den som vill bygga snarare än bara läsa.
  • Adam Tauman Kalai, Ofir Nachum, Santosh Vempala och Edwin Zhang (OpenAI och Georgia Tech) analyserade de statistiska orsakerna bakom hallucinationer i "Why Language Models Hallucinate" (2025).

Nya artiklar direkt i din inbox

Få uppdateringar när nya artiklar publiceras om AI, strategi och företagande.

Dela

LinkedInX

Citera denna artikel

Norström, A. (2026). Attention: historien bakom genombrottet, och varför den också förklarar hallucinationer. Terbis. https://terbis.se/sv/articles/attention-och-hallucinationer