De beste open-source realtime spraakagentmodellen in 2026
De meeste voice AI-demo's draaien op ElevenLabs gecombineerd met GPT-4o via een API. Die stack werkt - totdat u een data-residency-vereiste tegenkomt, een telefonie-integratie die niet via een Amerikaanse cloudprovider mag routeren, of een kostenmodel dat bij 100.000 gesprekken per maand niet meer rendabel is. Wanneer die beperkingen zich aandienen, wordt de vraag: welke self-hosted voice AI levert u daadwerkelijk in productie in 2026?
Dit artikel is bestemd voor engineeringteams die die keuze moeten maken. Het bespreekt de open-source modellen die een evaluatie waard zijn, de architectuurkeuze die bepaalt welke categorie model bij uw situatie past, en de latentieberekeningen die het verschil maken tussen voice AI die natuurlijk klinkt en voice AI waarbij gebruikers ophangen.
Wat is de werkelijke architectuurkloof in open-source voice AI?
Spraak-naar-spraak-modellen verwerken audio-invoer en produceren audio-uitvoer binnen één neuraal netwerk. Cascade-pipelines koppelen drie afzonderlijke modellen aan elkaar: een streaming ASR-model zet spraak om naar tekst, een taalmodel genereert een tekstrespons, en een realtime TTS-model converteert die respons terug naar audio. De architectuurkeuze bepaalt uw latentievloer, uw beheersbaarheidsplafond en uw engineeringcomplexiteit.
End-to-end spraak-naar-spraak-modellen zoals Moshi en Mini-Omni2 behouden prosodie en paralinguïstische signalen gedurende de volledige interactie. Ze kunnen onderbreken en worden onderbroken, omdat ze audio continu verwerken in plaats van te wachten op een volledige transcriptie. Het nadeel is een lagere tekstkwaliteit vergeleken met een state-of-the-art LLM, en minder stuurmogelijkheden voor engineeringteams die afzonderlijke pijplijnfasen willen beheersen.
Cascade-pipelines geven u controle in elke fase. U kunt het ASR-model vervangen, het LLM afstemmen op domeinspecifieke kennis en de prosodie van realtime TTS onafhankelijk instellen. De kwaliteit is hoger. Maar u koppelt drie latentiebudgetten aan elkaar, en beurtwissel en onderbrekingsafhandeling worden expliciete engineeringproblemen in plaats van emergent modelgedrag.
Geen van beide architecturen is universeel correct. De juiste keuze hangt af van uw latentie-SLA, de hardware waarop u kunt deployen en de mate waarin u de gesprekskwaliteit wilt beheersen.
Hoe werkt de latentieberekening voor een spraakagent?
Conversatielatentie is de tijd tussen het moment dat een gebruiker stopt met spreken en het moment dat de eerste byte van de respons van de agent wordt afgespeeld. Om een gesprek natuurlijk te laten voelen, moet dit getal onder de 700ms blijven. Boven de 1.200ms ervaren gebruikers de agent consequent als traag. Boven de 2.000ms stijgen de afhaakpercentages sterk.
De duplex audio-pipeline voor een cascade-architectuur kent vier opeenvolgende fasen:
-
Voice activity detection (VAD): 10-30ms. Silero VAD of WebRTC VAD detecteert wanneer de gebruiker is gestopt met spreken. Deze fase moet continu draaien en kan niet worden gebatcht.
-
Streaming ASR: 100-300ms. Het ASR-model transcribeert de uiting. Streaming ASR met NVIDIA Parakeet TDT of Faster-Whisper op een GPU-instantie kan dit onder de 150ms brengen voor uitingen korter dan 5 seconden.
-
LLM TTFT (time-to-first-token): 200-800ms. Dit is de dominante variabele. Een gekwantiseerde Llama 3 8B op een A10-instantie met een warme KV-cache kan 200-300ms TTFT bereiken. Een groter model of een koud contextvenster kan dit naar 800ms of meer duwen.
-
Realtime TTS: 50-200ms. De tijd om het eerste audiofragment te genereren en te streamen. Kokoro TTS en XTTS v2 kunnen beide het eerste audiofragment in minder dan 100ms produceren wanneer ze draaien op GPU met streaming-uitvoer.
Totaal bereik: 360ms-1.330ms. Het praktische doel voor een goed geoptimaliseerde self-hosted cascade is 500-700ms. Elke fase biedt optimalisatieruimte, maar LLM TTFT is waar de meeste teams het meeste laten liggen.
Voor end-to-end-modellen zoals Moshi geldt een ander latentiedoel. Het model draait continu, zodat de eerste audio-uitvoer kan beginnen voordat de gebruiker is uitgesproken. Theoretisch is low-latency inference haalbaar, maar de reële deploymentlatentie hangt af van de hardware die u kunt inzetten en het streambufferbeheer in uw serving-laag.
Welke open-source spraakmodellen zijn een evaluatie waard in 2026?
| Model / Architectuur | Aanpak | Latentie (TTFT) | Duplex-ondersteuning | Self-hostbaar | Het beste voor |
|---|---|---|---|---|---|
| Moshi (Kyutai) | End-to-end spraak-naar-spraak | ~200ms (streaming) | Volledige duplex, native | Ja (Apache 2.0) | Onderzoek, duplexprototypes, low-latency demo's |
| Mini-Omni2 | End-to-end spraak-naar-spraak | ~300-400ms | Gedeeltelijke duplex | Ja (MIT) | E2E-deployment met beperkte resources |
| VITA | Multimodaal (spraak + vision) | ~400-600ms | Nee | Ja (Apache 2.0) | Gecombineerde spraak- en visiontoepassingen |
| Ultravox (Fixie.ai) | Geoptimaliseerde cascade | ~350-500ms | Gedeeltelijk | Ja (CC-BY-4.0) | Productiekwaliteit cascade, sterke OSS-community |
| Faster-Whisper + Llama 3 + Kokoro TTS | Standaard cascade | ~500-900ms | Nee (vereist VAD-laag) | Ja (alle Apache/MIT) | Hoogste kwaliteit self-hosted voice-stack |
Moshi (Kyutai): Het eerste serieuze open-source duplexspraakmodel
Moshi werd eind 2024 door Kyutai als open source gepubliceerd en blijft het architectureel meest interessante open-source spraakmodel dat beschikbaar is. Het is een echte duplex audio-pipeline: het luistert en spreekt tegelijkertijd, verwerkt onderbrekingsafhandeling native en produceert audio met natuurlijke prosodie - kwaliteiten die cascade-pipelines expliciete engineering vereisen om te benaderen.
De inner monologue-architectuur is het mechanisme dat dit mogelijk maakt. Moshi onderhoudt een continue interne tekststroom naast zijn audiogeneratie, wat het model conversationele grounding geeft zonder een discrete ASR-dan-LLM-dan-TTS-pipeline. Dit is de architectuur die low-latency onderbreking mogelijk maakt op modelniveau, in plaats van dat er een aparte toestandsmachine nodig is.
De beperking is reëel: de conversationele redeneervaardigheden van Moshi zijn lager dan wat u krijgt door een goed LLM met een cascade-pipeline te combineren. Het is een sterk onderzoeks- en prototyperingplatform. Voor productie-deployments waarbij responskwaliteit conversie of gebruikerstevredenheid aanstuurt, heeft de meerderheid van de teams bij Seven Labs ervaren dat een goed afgestemde cascade beter presteert op de maatstaven die voor eindgebruikers relevant zijn.
Wanneer te gebruiken: Duplex spraakinterfaces waarbij latentie en natuurlijke onderbreking zwaarder wegen dan responskwaliteit, voice agent-onderzoek, vroege prototypes waarbij realtime inference-architectuur belangrijker is dan uitvoerkwaliteit.
Mini-Omni2: Kleiner, sneller, beter inzetbaar
Mini-Omni2 is de praktische end-to-end-optie voor teams die de hardwarevereisten van Moshi niet kunnen realiseren. Onder MIT-licentie draait het op bescheidener GPU-configuraties en levert toch spraak-naar-spraak-interactie zonder cascade. Spraakkwaliteit en conversationele coherentie liggen lager dan bij Moshi, maar het verschil met resource-beperkte alternatieven is kleiner dan de koptekstvergelijking van modellen suggereert.
Mini-Omni2 verwerkt basale beurtwissel, maar mist de volledige duplexarchitectuur van Moshi. Voor toepassingen waarbij het gespreksritme gestructureerd is - een spraakagent die een formulier invult, een FAQ-beantwoorder, een eenvoudige afspraakenplanner - is het kwaliteitsplafond voldoende en zijn de deploymentkosten beduidend lager.
Wanneer te gebruiken: Edge-gehoste of resource-beperkte end-to-end spraakagenten, toepassingen waarbij serverkosten zwaarder wegen dan absolute gesprekskwaliteit.
VITA: Wanneer u spraak en vision samen nodig heeft
VITA concurreert niet met Moshi of Mini-Omni2 op conversatielatentie. Het is een multimodaal model dat spraak en visuele invoer samen verwerkt, waardoor het relevant is voor geheel andere toepassingen: visuele inspectiewerkstromen waarbij een veldtechnicus beschrijft wat hij ziet, productdemonstratie-agenten die reageren op afbeeldingen, of toegankelijkheidstools die tegelijkertijd moeten zien en spreken.
Als uw spraakagent puur conversationeel is, is VITA niet het juiste evaluatiedoel. Als u spraak plus vision in één self-hosted model nodig heeft, is VITA momenteel de sterkste open-source optie die beschikbaar is.
Wanneer te gebruiken: Multimodale spraak-plus-vision-agenten, toegankelijkheidstoepassingen, product- of documentinteractiewerkstromen.
Ultravox (Fixie.ai): De cascade die concurreert met end-to-end
Ultravox past de cascade-architectuur toe en optimaliseert agressief op latentie, met name bij de ASR-naar-LLM-overdracht. Uitgebracht onder CC-BY-4.0 met een actieve open-sourcecommunity is het de referentie-implementatie geworden voor teams die cascade-kwaliteit willen combineren met end-to-end-concurrerende latentie. Voice agent orchestration-tooling rondom Ultravox is rijper dan wat er bestaat voor Moshi of Mini-Omni2.
De CC-BY-4.0-licentie vereist naamsvermelding. Controleer dit aan de hand van uw deploymentvoorwaarden voordat u naar productie gaat.
Wanneer te gebruiken: Productie-cascade-deployments waarbij community-tooling, documentatie en integratieondersteuning even zwaar wegen als pure modelprestaties.
Is een standaard cascade-pipeline nog steeds de beste self-hosted voice-stack?
Ja, voor de meeste productie-deployments in 2026. De combinatie van Faster-Whisper (of NVIDIA Parakeet TDT voor Engelstalige streaming), Llama 3 of een domein-fijngesteld afgeleid model, en Kokoro TTS levert momenteel de beste kwaliteit-latentieverhouding onder self-hosted opties. Het nadeel is engineeringcomplexiteit: u bent verantwoordelijk voor voice activity detection, u beheert de toestandsmachine voor beurtwissel en u verwerkt onderbrekingsafhandeling op orkestratieniveau.
Dat is geen kleine afweging. Onderbrekingsafhandeling is het moeilijkste engineeringprobleem in productiesspraakagenten - niet de modelkwaliteit. Wanneer een gebruiker halverwege een zin onderbreekt, moet uw systeem de onderbreking binnen 20-50ms detecteren via VAD, de actieve TTS-stream annuleren, de audiobuffer zonder artefacten leegmaken, de lopende LLM-generatie verwerpen en de ASR-naar-LLM-cyclus herstarten met de nieuwe uiting - zonder dat de gebruiker een merkbare storing ervaart. Dit correct uitvoeren vereist zorgvuldig streambeheer dat geen enkel model kant-en-klaar levert.
De drie-model cascade-stack geeft u maximale controle over elk van deze beslissingen. Het afzonderlijk afstemmen van de fasen is ook hoe u de kloof met end-to-end-modellen op conversatielatentie verkleint.
Wat betekent WebRTC versus telefonie voor uw voice agent-architectuur?
WebRTC en telefonie-integratie zijn twee verschillende transportlagen, en de keuze beïnvloedt uw volledige stack.
WebRTC is de juiste keuze voor browsergebaseerde of app-gebaseerde spraakagenten. Het verwerkt peer-to-peer-audio met ingebouwde echoreductie, ruisonderdrukking en adaptieve bitrate. Integratie met uw voice AI-stack vereist een WebRTC-mediaserver (mediasoup, LiveKit of Daily.co) die de WebRTC-stream verbindt met de audio-invoer van uw ASR-model. Latentie van browser naar inference is beheersbaar en de volledige stack kan binnen uw cloudinfrastructuur blijven.
Telefonie-integratie (SIP/PSTN) is vereist voor spraakagenten die op echte telefoonnummers moeten bellen of gebeld worden. Dit betekent een SIP-trunkprovider, een mediagateway en een SIP-compatibel framework (Asterisk, FreeSWITCH) of een telefonie-API (Twilio, Vonage, Telnyx) die verbinding maakt met uw AI-stack. PSTN-audio is G.711 op 8kHz - een aanzienlijke kwaliteitsverslechtering ten opzichte van breedband-audio van WebRTC, die zowel de ASR-nauwkeurigheid als de TTS-natuurlijkheid beïnvloedt. Streaming ASR-modellen die zijn getraind op breedband-audio moeten specifiek worden geëvalueerd op telefoonaudio voordat u naar productie gaat.
Seven Labs heeft een WhatsApp voice AI-leadkwalificatieagent gedeployed voor een vastgoedklant in Dubai. De agent verwerkte zowel het WebRTC-pad voor webgestarte gesprekken als het WhatsApp-audioberichtpad voor inkomende leads. De architectuur scheidde de transportlaag schoon van de AI-inferentielaag, zodat het team ASR en LLM onafhankelijk van kanaalspecifieke audiobeperkingen kon optimaliseren. U kunt de volledige technische uitwerking lezen in onze WhatsApp AI-leadkwalificatiecasestudy voor Dubai vastgoed.
[Insert Seven Labs engineer quote on production voice agent latency budget]
Hoe ziet de productie self-hosted voice-stack er in de praktijk uit?
Op basis van Seven Labs' productie voice AI-deployments ziet de stack die consistent wordt opgeleverd en schaalt er als volgt uit:
- VAD-laag: Silero VAD draait continu en detecteert spraakgrenzen binnen 20ms. Dit is wat onderbreking mogelijk maakt - niet het AI-model.
- Streaming ASR: Faster-Whisper large-v3 of NVIDIA Parakeet TDT voor Engels, Qwen3-ASR 1.7B voor Arabische of meertalige omgevingen. Beide draaien op A10-instanties met een realtime factor onder 0,1.
- LLM-inference: Llama 3 8B of 70B (gekwantiseerd), geserveerd via vLLM met speculatieve decodering en warme KV-cache. De context bevat gespreksgeschiedenis, persona-prompt en eventuele RAG-retrieval voor domeinkennis.
- Realtime TTS: Kokoro TTS voor Engels (laagste latentie, MIT-licentie), XTTS v2 voor stemkloningsvereisten, Coqui/VITS voor meertalige of Arabische uitvoer.
- Orkestratielaag: Een op maat gemaakte toestandsmachine die beurtwissel, onderbrekingsannulering, streamlevenscyclus en fallback-routering beheert. Dit is de laag die de meeste open-source frameworks onderbelichten en waar de meeste productiesspraakagenten mislukken.
De volledige pipeline bevindt zich in uw infrastructuur. Audio verlaat uw omgeving nooit. Self-hosted voice stack-deployment betekent dat u de dataketen beheert van gebruikersmicrofoon tot agentrespons.
Belangrijke beslissingen die de orkestratielaag moet afhandelen:
- Onderbrekingsdetectie en streamannulering
- Stilherteclassificatie (pauze versus beurt-einde versus uitgebreide stilte)
- Drempelwaarde voor barge-in (hoe lang na het begin van spraak voordat een onderbreking wordt geactiveerd)
- Fallback wanneer ASR-betrouwbaarheid laag is
- Foutherstel wanneer LLM-generatie vastloopt
Voor teams die conversationele AI-architectuur van de grond af opbouwen, zijn dit de beslissingen die de meeste engineeringtijd kosten - niet de modelselectie. Modelselectie is een benchmark-oefening van drie uur. Onderbrekingsafhandeling is een engineeringvraagstuk van twee weken.
Om te begrijpen hoe wij de volledige AI-platformengineering en automatiseringsinfrastructuur aanpakken die productiesspraakagenten ondersteunt, beschrijven die servicepagina's het leveringsmodel dat we toepassen bij klantdeployments.
Veelgestelde vragen
Wat is het beste open-source realtime spraakagentmodel in 2026?
Voor end-to-end spraak-naar-spraak is Moshi (Kyutai) de architectureel meest volwassen open-source optie, met echte duplexondersteuning en native onderbrekingsafhandeling. Voor productiekwaliteit levert een cascade-pipeline met Faster-Whisper of Parakeet TDT, Llama 3 en Kokoro TTS betere conversationele uitvoer tegen de prijs van meer orkestratietechniek. Het juiste antwoord hangt af van uw latentievereisten, hardwarebudget en of duplexgedrag of responskwaliteit de hogere prioriteit heeft.
Hoe verlaag ik de latentie in een self-hosted spraakagent-pipeline?
Richt u op elke fase afzonderlijk. Voor ASR gebruikt u een streaming-model (Parakeet TDT of Faster-Whisper met streaming-uitvoer) in plaats van te wachten op een volledige uiting. Voor LLM serveert u met vLLM of TGI met speculatieve decodering, houdt u het contextvenster warm en gebruikt u het kleinste model dat aan uw kwaliteitsdrempel voldoet. Voor TTS gebruikt u een model dat het eerste audiofragment streamt voordat de generatie is voltooid. Een totale latentie onder de 600ms is haalbaar met deze aanpak op A10 GPU-infrastructuur.
Wat is het verschil tussen Moshi en een cascade voice-pipeline?
Moshi is een end-to-end spraak-naar-spraak-model dat audio-invoer verwerkt en audio-uitvoer produceert binnen één neuraal netwerk, wat echte duplexconversatie en natuurlijke onderbrekingsafhandeling mogelijk maakt. Een cascade-pipeline koppelt drie afzonderlijke modellen: streaming ASR zet spraak om naar tekst, een LLM genereert een tekstrespons en een TTS-model converteert die respons naar audio. Cascade-pipelines leveren hogere responskwaliteit en meer engineeringcontrole; Moshi levert lagere architectuurlatentie en native duplexgedrag.
Kan ik een spraakagent self-hosten zonder dat audio mijn infrastructuur verlaat?
Ja. Elk model in dit artikel kan on-premises of in een private cloud-VPC worden gedeployed. De volledige cascade-stack (Faster-Whisper + Llama 3 + Kokoro TTS) en Moshi draaien beide op standaard NVIDIA GPU-instanties. Audio verlaat uw omgeving nooit, waarmee u voldoet aan de vereisten van de AVG, HIPAA en data-residencyregels die cloud voice-API's problematisch maken in gereguleerde sectoren.
Wat is het moeilijkste engineeringprobleem bij het bouwen van een productiesspraakagent?
Onderbrekingsafhandeling. Het detecteren van een gebruikersbarge-in via VAD, het annuleren van actieve TTS-audio, het leegmaken van de audiobuffer zonder artefacten en het schoon herstarten van de inferentiecyclus - alles binnen 50ms - is het probleem dat de meeste open-source frameworks niet oplossen. Modelkwaliteit is secundair; een spraakagent die onderbrekingen niet soepel kan verwerken, zal in productie mislukken ongeacht hoe nauwkeurig zijn ASR is of hoe natuurlijk zijn TTS klinkt.
Seven Labs bouwt productie voice AI-infrastructuur: self-hosted, lage latentie en geïntegreerd met uw telefonie- en berichtenstack.
In onze AI-engineeringopdrachten hebben we spraakagenten opgeleverd voor leadkwalificatie, klantenondersteuning en meertalige conversationele interfaces - van WhatsApp-audiopipelines tot WebRTC-browseragenten en SIP-telefonie-deployments. Als uw team self-hosted voice AI-architectuur evalueert, helpen we u bij het selecteren van de juiste stack, het bouwen van de orkestratielaag en het veilig deployen in uw omgeving.
Bekijk ons AI-platformengineering-werk of ontdek hoe we voice AI inzetten voor bedrijfsautomatiseringswerkstromen.

