AI-transkribering kämpar med svenska dialekter främst för att modellerna är tränade på rikssvenska och saknar tillräcklig exponering för den prosodi, det ordförråd och den grammatik som kännetecknar dialektgrupper som sydsvenska mål, norrländska mål och götamål. När en talare avviker markant från standardspråket ökar antalet feltranskriberade ord kraftigt.
Sverige rymmer minst fem huvudsakliga dialektgrupper med distinkta ljudsystem, och skillnaderna mellan dem kan vara så stora att en AI-modell som fungerar väl på uppläst rikssvenska producerar närmast obrukbar text när den möter brett dialektalt tal. Nedan går vi igenom vilka dialekter som ställer till mest problem, hur tekniken fungerar, vad som kan göras för att förbättra resultatet och när manuell transkribering är det klokare valet.
Vilka svenska dialekter ställer till mest problem för taligenkänning?
De dialektgrupper som orsakar flest fel i AI-baserad taligenkänning är sydsvenska mål (framför allt skånska), norrländska mål och götamål. Gemensamt för dem är att de avviker från rikssvenska i satsmelodi, vokaluttal och ibland även i grammatik och ordförråd, vilket gör att modeller tränade på standardsvenska får svårt att tolka talet korrekt.
Institutet för språk och folkminnen (Isof) är den nationella myndigheten för forskning om svenska dialekter och delar in dem i flera huvudgrupper. Inom Sveriges gränser talar vi om sydsvenska mål, götamål, sveamål, norrländska mål och gotländska. Varje grupp har sina egna drag, men det är skillnaderna i prosodi och fonetik som skapar störst utmaningar för automatisk transkribering.
Sydsvenska mål och skånska
Skånska talas av ungefär en miljon svenskar och kännetecknas av rundade vokaler, mjukare konsonantuttal och en satsmelodi som påminner mer om danska än om centralsvenska. En mening som på rikssvenska låter ”Jag vet inte var han är” kan på bred skånska bli något i stil med ”Ja ve inte va han ä.” Den förändrade fonetiken gör att en AI-modell ofta substituerar eller helt hoppar över ord. Kungliga biblioteket har konstaterat att deras svenskanpassade modell nu klarar skånska nästan felfritt, men att andra dialekter fortfarande bjuder motstånd.
Norrländska mål och götamål
Norrländska mål spänner över ett stort geografiskt område, från Gävleborg till Norrbotten, och inkluderar varianter med utdragna vokaler och ålderdomliga grammatiska drag. I orter som Klövsjö i Jämtland eller Burträsk i Västerbotten kan dialekten vara svår att förstå även för andra svensktalande. Götamål, inklusive göteborgska och västgötska, har sin egen karakteristiska melodi och vokalkvalitet. Gotländska utgör ytterligare en distinkt grupp med egna prosodiska mönster. Samtliga dessa varianter ligger långt från den standardsvenska som AI-modeller primärt tränats på.
Hur fungerar AI-baserad taligenkänning för svenska?
AI-baserad taligenkänning för svenska använder maskininlärningsmodeller som omvandlar ljudvågor till text genom att matcha ljudmönster mot inlärda språkmodeller. De ledande verktygen, som OpenAI Whisper, Google Speech-to-Text och Microsoft Azure, är alla primärt tränade på engelska data, vilket innebär att svenska får betydligt mindre träningsdata och därmed sämre resultat.
Under optimala förhållanden, med tydligt tal, god ljudkvalitet och en talare som använder rikssvenska, kan modern AI-transkribering nå en noggrannhet på omkring 85 till 95 procent. Det innebär att mellan 5 och 15 av 100 ord kan bli fel, utelämnade eller tillagda. Felmåttet kallas Word Error Rate (WER) och är branschstandard för att mäta transkriberingskvalitet.
Problemet uppstår när förutsättningarna inte är optimala. Svenska har i sig utmaningar som sammansatta ord, variabel ordföljd och regionala uttalsskillnader. Lägg till bakgrundsljud, flera talare som pratar samtidigt eller dialektalt tal, och noggrannheten kan sjunka till 60 till 70 procent. I praktiken innebär det att vart tredje ord kan bli fel, och den transkriberade texten kräver omfattande manuell korrigering för att bli användbar.
En viktig orsak till att svenska dialekter transkriberas sämre är att träningsdatan ofta består av webb- och mediematerial, som YouTube-klipp och nyhetsuppläsningar, där rikssvenska dominerar. Modellen har helt enkelt inte hört tillräckligt med dialektalt tal för att lära sig känna igen dess mönster.
Vad kan man göra för att förbättra transkriberingen av dialektalt tal?
Det mest effektiva sättet att förbättra transkriberingen av dialektalt tal är att använda modeller som är finjusterade på svenska dialektdata, kombinera AI-transkribering med manuell granskning och välja rätt transkriberingsnivå för materialet. Forskningen har tagit stora steg framåt, men inget verktyg klarar brett dialektalt tal helt utan mänsklig insats.
Svenskanpassade AI-modeller
KBLab vid Kungliga biblioteket har utvecklat KB-Whisper, en modell som finjusterats med över 50 000 timmar transkriberat svenskt tal. Träningsdatan inkluderar material från Sveriges Television, Riksdagen och, inte minst, dialektinspelningar från Isof som sträcker sig tillbaka till 1935. Resultatet är en modell som i genomsnitt minskar felfrekvensen med nära hälften jämfört med OpenAI:s generella Whisper-modell. Modellen erbjuder dessutom tre transkriberingsstilar: en kondenserad version för undertexter, en balanserad standardversion och en strikt version som bevarar tvekljud och talspråkliga drag, något som är värdefullt för forskare som arbetar med dialektmaterial.
Verbatim kontra standardiserad transkribering
Valet mellan verbatim och standardiserad transkribering har stor betydelse för dialektmaterial. En verbatim transkribering bevarar talarens dialektala drag, tvekljud och grammatiska avvikelser från standardspråket. Den ger en trogen bild av hur talet faktiskt lät. En standardiserad transkribering omvandlar dialektalt tal till rikssvensk skriftform och gör texten lättare att söka i och analysera, men dialektala nyanser går förlorade. I praktiken avgör syftet med transkriberingen vilken metod som passar bäst.
Tänk dig en muntlig historieinsamling från Norrbotten. En äldre talare berättar om livet i inlandet under 1950-talet, med ett språk fullt av lokala uttryck, ålderdomliga böjningsformer och en melodi som skiljer sig markant från rikssvenska. En AI-modell tränad på standardsvenska kan missa centrala ord och vända meningar till obegripliga fragment. En verbatim transkribering utförd av en erfaren språkvetare bevarar talarens röst och dialektala identitet, medan en standardiserad version gör materialet sökbart för framtida forskare. Båda har sitt värde, men ingen av dem kan produceras tillförlitligt av enbart AI när utgångsmaterialet är starkt dialektalt.
När bör man välja manuell transkribering framför AI?
Manuell transkribering bör väljas framför AI när materialet innehåller starkt dialektalt tal, känsligt innehåll som kräver hög säkerhet, tekniska facktermer eller inspelningar med dålig ljudkvalitet och överlappande talare. I dessa situationer kan AI-transkriberingens felfrekvens bli så hög att den manuella korrigeringen tar lika lång tid som att transkribera från grunden.
Professionella mänskliga transkriberare når typiskt en noggrannhet på 95 till 99 procent. De förstår kontext, känner igen dialektala uttryck och kan tolka ironiska eller tvetydiga formuleringar som AI missar. För kvalitativ forskning, där språkliga nyanser, accenter och kulturella sammanhang har direkt betydelse för analysen, är mänsklig transkribering ofta det enda alternativet som ger tillräcklig kvalitet.
Det finns dock situationer där AI är det rimliga valet. Stora volymer material med tydligt rikssvenskt tal, korta deadlines och begränsad budget talar för automatisk transkribering. En hybridmetod, där AI producerar ett första utkast som sedan granskas och korrigeras av en språkvetare, automatiserar ofta merparten av arbetet och kräver betydligt mindre manuell insats än att börja från noll.
Känsligt material, exempelvis juridiska inspelningar eller forskningsintervjuer med identifierbara personer, kräver dessutom att transkriberingen sker i en säker miljö med GDPR-efterlevnad. Det räcker inte att resultatet är korrekt; hela hanteringskedjan måste vara trygg.
Vi på Spoken kombinerar AI-verktyg med erfarna språkvetare och hanterar allt material i vårt eget slutna system. Våra transkriberare har erfarenhet av dialektalt tal och kan anpassa transkriberingsnivån efter materialets karaktär och ditt syfte, oavsett om det handlar om en forskningsintervju från Norrbotten eller ett möte med deltagare från flera dialektområden.
Behöver du hjälp med transkribering av dialektalt material eller vill veta mer om hur vi arbetar? Be om en offert så återkommer vi inom 24 timmar.