Eine Stimme aufbauen: Sprechen, Verstehen, Antworten
Wenn man mit XNeuronal spricht, scheint alles sofort zu geschehen. Dahinter arbeiten drei verschiedene Ebenen zusammen, um deine Stimme in eine Antwort zu verwandeln, und eine Architekturwahl, die wir voll und ganz vertreten.
Drei Ebenen: hören, denken, sprechen
Der Weg eines Satzes folgt immer demselben Pfad. Zuerst die Transkription (STT): Audio wird zu Text. Dann das Denken: Ein Sprachmodell versteht die Absicht, ordnet die Neuronen, entscheidet, was zu antworten ist. Schließlich die Synthese (TTS): Text wird wieder zu einer Stimme. Jede Ebene ist ein unabhängiger Dienst, der ersetzt werden kann, ohne die anderen zu beeinflussen. Diese Modularität ist kein Luxus: Sie ermöglicht es uns, den Anbieter zu wechseln, wenn ein besserer erscheint, ohne das Produkt neu schreiben zu müssen.
Immer ein Sicherheitsnetz
Ein externer Dienst kann langsam, überlastet oder ausfallen. Wir haben daher jede Ebene kaskadenförmig aufgebaut: Wenn die Haupt-Engine ausfällt, übernimmt eine Ersatz-Engine, ohne dass der Benutzer es merkt. Die Transkription wechselt von einem Anbieter zum anderen, die Synthese greift auf eine Stimme desselben Geschlechts zurück. Das Ziel ist einfach: Der Ausfall eines Dienstleisters darf niemals zu einem Ausfall des Assistenten werden.
Warum Push-to-Talk und keine Unterbrechung
Wir hätten von Anfang an auf kontinuierliche Konversation abzielen können, bei der die KI dich unterbricht und antwortet, bevor dein Satz zu Ende ist. Wir haben das Gegenteil gewählt: ein einfaches Drücken zum Sprechen, ein Loslassen zum Zuhören. Das ist kein Mangel an Ehrgeiz, sondern eine Kalkulation. Der Markt für Echtzeit-Sprache ändert sich jeden Monat; heute Full-Duplex für einen Anbieter vorzukodieren, bedeutet, in sechs Monaten toten Code zu schreiben. Besser ist eine nüchterne und solide Basis, die bereit ist, diese Wahl zum richtigen Zeitpunkt zu treffen.
Die Latenz, die wir akzeptieren, die, die wir ablehnen
Darum geht es: Welche Wartezeit ist tolerierbar. Ein bis zwei Sekunden für eine durchdachte Antwort sind akzeptabel, es ist sogar beruhigend, es signalisiert, dass der Assistent denkt. Was wir ablehnen, ist die erzwungene Wartezeit: ein stiller Fehler, eine Stimme, die nie kommt. Die Nüchternheit der Pipeline ist genau das, was uns erlaubt, diese Grenze zu kontrollieren.

