Vad som händer
Efter en diktering innehåller texten ord eller hela meningar du aldrig sa — ofta något som låter som en fras från en undertextad video eller ett vanligt talspråksuttryck, som inte alls hör till sammanhanget.
Varför det händer
Whisper-modeller — grundmodellen bakom både generisk Whisper och KB-/NB-Whisper — är tränade mycket på undertextat videomaterial. När modellen får tystnad eller enbart rumsljud att tolka kan den ibland ”hallucinera” fram text som är typisk för den träningsdatan, istället för att korrekt känna igen att inget sades. Fenomenet är väldokumenterat för Whisper-modeller generellt och förvärras av bakgrundsljud som andning eller ventilation, en mikrofon med hög känslighet, eller en inspelning som fortsätter en stund efter att du slutat prata.
Så minskar du risken
- Avsluta inspelningen så snart du är klar, istället för att låta den fortsätta gå i tystnad
- Sänk mikrofonens känslighet om den fångar mycket bakgrundsljud, i Systeminställningar → Ljud → Ingång
- Använd headset eller en riktad mikrofon i bullriga miljöer istället för den inbyggda mikrofonen
Om problemet kvarstår
Det här är ett känt beteende i själva Whisper-modellen, inte något Sæga kan eliminera helt. Händer det ofta och stör ditt arbetsflöde, hör gärna av dig — det hjälper oss prioritera framtida förbättringar av tystnadsdetekteringen.
Skicka ett exempel och en logg →Se även: Dikteringen klipps av i slutet