Costruire una voce: parlare, capire, rispondere
Quando parli con XNeuronal, tutto sembra istantaneo. Dietro le quinte, tre livelli distinti si alternano per trasformare la tua voce in una risposta, ed è una scelta architetturale che sosteniamo pienamente.
Tre livelli: sentire, pensare, parlare
Il percorso di una frase segue sempre lo stesso cammino. Prima la trascrizione (STT): l'audio diventa testo. Poi il ragionamento: un modello linguistico comprende l'intenzione, organizza i neuroni, decide cosa rispondere. Infine la sintesi (TTS): il testo ridiventa voce. Ogni livello è un servizio indipendente, sostituibile senza toccare gli altri. Questa modularità non è un lusso: ci permette di cambiare fornitore quando ne appare uno migliore, senza riscrivere il prodotto.
Sempre una rete di sicurezza
Un servizio esterno può essere lento, saturo o cadere. Abbiamo quindi progettato ogni livello a cascata: se il motore principale fallisce, un motore di riserva subentra senza che l'utente se ne accorga. La trascrizione passa da un fornitore all'altro, la sintesi ricade su una voce dello stesso genere. L'obiettivo è semplice: un guasto di un fornitore non deve mai diventare un guasto dell'assistente.
Perché il push-to-talk, e non l'interruzione
Avremmo potuto puntare fin da subito alla conversazione continua, dove l'IA ti interrompe e risponde prima della fine della tua frase. Abbiamo scelto l'opposto: una semplice pressione per parlare, un rilascio per ascoltare. Non è mancanza di ambizione, è un calcolo. Il mercato della voce in tempo reale si muove ogni mese; pre-codificare oggi il full-duplex per un fornitore significa scrivere codice morto tra sei mesi. Meglio una base sobria e solida, pronta ad accogliere questa scelta al momento giusto.
La latenza che accettiamo, quella che rifiutiamo
Tutta la posta in gioco è qui: quale attesa è tollerabile. Uno o due secondi per una risposta ponderata è accettabile, è persino rassicurante, segnala che l'assistente pensa. Ciò che rifiutiamo è l'attesa subita: un fallimento silenzioso, una voce che non arriva mai. La sobrietà della pipeline è proprio ciò che ci permette di controllare questo confine.

