Mätning · Taligenkänning
KB-Whisper mot Pianissimo — vi mätte fyra svenska talmodeller på 1804 dialektklipp
Den 24 september 2026 släppte Klang AI i Helsingborg Pianissimo, en öppen svensk talmodell under CC BY 4.0. Den ställdes direkt mot KB-Whisper från KBLab, Kungliga bibliotekets forskningslabb. Båda är finjusteringar på tiotusentals timmar svenskt tal, KB-Whisper från OpenAIs Whisper och Pianissimo från NVIDIAs Parakeet. Men ingen utomstående hade jämfört dem.
Så vi gjorde det. Fyra modeller, 1804 klipp, samma metod för alla. Den här artikeln är resultatet, och längst ner ligger rådatan så att du kan räkna om tabellen utan att lita på oss.
Varför mätningen behövdes
När Klang släppte Pianissimo publicerade de också en jämförelse mot KB-Whisper. Det är hederligt gjort, och deras tal visade sig hålla. Men två saker saknades.
Det första är kb-whisper-small. Den fanns inte med, och det är just den modell som de flesta svenska dikteringsappar faktiskt kör, eftersom den är den enda som är liten nog att kännas snabb. En jämförelse som utelämnar den svarar alltså inte på frågan de flesta användare har.
Det andra är att ingen utomstående hade kört siffrorna. En modelltillverkares egen tabell är inte fel för att den är deras, men den är okontrollerad tills någon annan kommer fram till samma sak.
Vi hade dessutom ett konkret skäl: vi skulle bestämma vilken modell som ska vara förvald för svenska i Sæga. Det beslutet får inte vila på en tabell någon annan skrivit, och inte heller på ett par meningar genom talsyntes.
Metoden
Mätningen körs på Klang Dialects, ett öppet riktmärke för svensk taligenkänning som Klang AI släppte tillsammans med modellen, under CC BY 4.0. Det är 1804 klipp, 5,1 timmar tal och 656 talare, medvetet spretigt i fråga om dialekt och talstil. Det är det svåraste svenska materialet som finns fritt tillgängligt.
Att använda deras riktmärke är ett medvetet val. Hade vi byggt ett eget hade vi också byggt dess svagheter, och ingen hade kunnat kontrollera oss. Nu går båda delarna: deras publicerade tal blir en kontroll på vår uppsättning, och vår uppsättning blir en kontroll på deras tal.
Normaliseringen är också deras, ordagrant ur modellkortet: gemener, skiljetecken utbytta mot blanksteg, kollapsade mellanrum, och ordfelsprocent räknad på korpusnivå i stället för som medelvärde per klipp. Samma metod för alla fyra modellerna, samma maskin, en M-serie-Mac.
Resultatet
| Modell | Vi mätte | Klang publicerade | Klipp helt utan fel | Grova haverier |
|---|---|---|---|---|
| kb-whisper-large | 2,52 % | 2,30 % | 83,9 % | 8 |
| kb-whisper-medium | 3,81 % | 3,58 % | 77,5 % | 13 |
| Pianissimo | 4,94 % | 4,85 % | 70,1 % | 12 |
| kb-whisper-small | 5,72 % | opublicerad | 70,1 % | 20 |
Ordfelsprocent på korpusnivå, lägre är bättre. ”Grova haverier” = klipp där över hälften av orden blev fel.
Våra tal ligger konsekvent en aning över Klangs publicerade, för alla tre modeller de rapporterat: +0,22 procentenheter för kb-large, +0,23 för kb-medium och +0,09 för Pianissimo. Avvikelsen pekar alltså åt samma håll hela vägen och är liten, vilket är precis vad man vill se: någon detalj i förbehandlingen skiljer, inte bedömningen av vilken modell som är bäst.
Det betyder att rangordningen håller, och att det fjärde talet — kb-whisper-small, som ingen publicerat — går att lita på i samma utsträckning som de tre andra.
Hela tabellen ovan är dessutom omräknad ur exakt de filer som länkas längst ner, mot referenstexter hämtade direkt från datasetet, i stället för kopierad från körningen. Reproducerbarheten är alltså prövad och inte bara påstådd.
Vad siffrorna faktiskt säger
kb-whisper-large är påtagligt bättre, inte marginellt. 83,9 procent av klippen blev helt rätt mot mediums 77,5, och klipp för klipp vinner den 255 mot 110. Den har dessutom färst antal grova haverier av alla fyra. Om det enda som betyder något är att texten blir rätt är det den här du ska köra.
kb-whisper-small är dominerad av både kb-medium och Pianissimo. Sämre kvalitet än medium, och sämre än Pianissimo på både kvalitet och hastighet. Det är det enda entydiga i hela mätningen, och det är ett problem för branschen snarare än för KBLab: small var ett rimligt val så länge alternativet var att vänta, och det är det inte längre.
Pianissimos övertag över small är litet. Båda får 70,1 procent av klippen helt rätt, och head-to-head vinner Pianissimo 319 klipp mot 289. Över hela materialet blir det 920 felaktiga ord mot smalls 1066, alltså 146 ords skillnad. Drygt hälften av den skillnaden, 82 ord, kommer från de 20 klipp där small havererar grovt, mot Pianissimos 12; resten ligger utspridd över vanliga klipp.
Mot kb-medium är Whisper fortfarande 1,1 procentenheter bättre. Pianissimo är inte den mest träffsäkra svenska modellen, och Klang påstår inte heller det. Den är den snabbaste, med god marginal.
Hastighet, och varför den står för sig
Latens går inte att lägga i samma tabell utan att bli missvisande, av två skäl. Den beror på maskinen, och våra tal kommer från två olika körningar där kb-medium gav 680 millisekunder i den ena och 785 i den andra på exakt samma ljud. Det är kvoten mellan raderna som betyder något, inte talen i sig.
På 5,9 sekunder svenskt tal, varm motor, median av tre körningar på samma Mac:
- Pianissimo: 60 ms. Körs på Neural Engine i stället för på grafikkortet.
- kb-whisper-small: 270 ms, alltså drygt fyra gånger längre.
- kb-whisper-medium: 680 ms, ungefär elva gånger Pianissimo.
- kb-whisper-large: uppmätt till 1,8 gånger medium i en separat körning.
Klang anger själva 3600 gånger realtid för Pianissimo, alltså en timme ljud på en sekund. Det är en riktig siffra, men den gäller deras egen körning i batch på serverhårdvara. Vår uppmätta väg på en vanlig Mac, klipp för klipp, ligger på runt 100 till 165 gånger realtid. Båda talen är sanna om olika saker, och att låna deras i vår egen marknadsföring hade varit osant.
Vad vi gjorde med svaret
Sæga kör båda modellfamiljerna och låter användaren välja, men någon måste vara förvald. Vi valde kb-whisper-medium, alltså varken den snabbaste eller den mest träffsäkra.
Skälet att inte ta large är minne, inte kvalitet. Talmodellen ligger laddad så länge appen kör, och large betyder då ungefär 1,5 GB från inloggning till avstängning för ett menyradsverktyg som mest står stilla. En förvald modell måste vara trygg för den som aldrig öppnar en inställning. Large är ett klick bort och gratis.
Skälet att inte ta Pianissimo som förval är att ett fel är tyst medan en väntan är synlig. Räknat med talen ovan: skillnaden är 620 millisekunder på sex sekunders tal. Den växer långsammare än ljudet, eftersom Whispers kodare alltid arbetar mot ett fast trettiosekundersfönster hur kort inspelningen än är, så en dubbelt så lång diktering kostar inte dubbelt så lång väntan. Hundra vanliga dikteringar sparar därför i storleksordningen en till två minuter, med samma reservation som ovan: de absoluta talen skiljer mellan körningar. Samma hundra dikteringar om trettio ord kostar ungefär 34 extra felord, vilket är ungefär lika mycket tid att rätta. När aritmetiken är oavgjord avgör annat, och ett felstavat namn som följer med in i ett mejl kostar mer än en sekunds väntan.
Det är värt att säga rakt ut: den modell vi lyfte mest i den release det här gällde är den minst träffsäkra av tre, och den vi inte förvalde är den bästa. Ett riktmärke där författarens egna val råkar vinna varje kolumn är inget riktmärke.
Räkna om det själv
Hypoteserna från körningen ligger uppe, en JSONL-fil per modell, med klipp-id och den text modellen producerade:
- hyp-kb-whisper-large.jsonl
- hyp-kb-whisper-medium.jsonl
- hyp-pianissimo.jsonl
- hyp-kb-whisper-small.jsonl
Referenstranskripten och ljudet hämtar du från KlangAI/klang-dialects på Hugging Face. Vi återpublicerar varken deras ljud eller deras facit, bara våra egna modellutdata. Normalisera enligt modellkortet, räkna ordfelsprocent på korpusnivå, och du ska landa på tabellen ovan.
Tack
Till KBLab vid Kungliga biblioteket för KB-Whisper, och till Klang AI för Pianissimo och för att de släppte sitt riktmärke öppet i stället för att bara publicera resultatet. Den här artikeln hade inte gått att skriva annars.
Vill du välja modell i praktiken i stället för att läsa om siffrorna: så här väljer du talmodell i Sæga →
Sæga laddar ner och kör KB-Whisper och Pianissimo lokalt. Varje talmodell är gratis, och ljudet lämnar aldrig datorn.
Ladda ner Sæga — gratis att börja