Microfoni della postazioneAudio acquisito al bancone, sui due lati.
Thin clientDisplay da 8 pollici e modulo operatore da 5 pollici.
Rete locale dell'edificioNessun instradamento verso l'esterno.
Server on-premise, piattaforma NVIDIA CUDARiconoscimento, estrazione delle entità, traduzione e riepilogo.
Tutta l'inferenza avviene nell'edificio. Nessun audio, video o testo esce. Nessun collegamento internet richiesto.
Dispositivo casa
Uso personale, portatile.
Perimetro: il dispositivo
Microfoni integratiAcquisizione in ambiente domestico.
Edge AI, piattaforma Qualcomm DragonWingModelli eseguiti a bordo, sul processore neurale: riconoscimento e segmentazione dei parlanti.
Schermo e LED RGBTesto con un colore per voce, segnalazione dei suoni ambientali.
L'audio non lascia mai il dispositivo. Batteria integrata, nessun account, nessuna rete richiesta.
Il software
Un client sottile, un server che fa il lavoro.
Il client cattura e mostra. Non decide, non archivia, non parla con l'esterno.
Due client, due implementazioni
Allo sportello il client gira su ESP32, dentro i due display. In casa è un'applicazione Linux sul dispositivo stesso. In entrambi i casi fa le stesse tre cose: acquisisce audio e video — il video serve al riconoscimento della lingua dei segni — mostra il testo, accetta il tocco.
Dove c'è il server, i modelli sono più grandi
La postazione da sportello si appoggia al server on-premise, e questo permette modelli di riconoscimento più grandi: meno errori sulle parole e la punteggiatura al posto giusto. È la punteggiatura che rende un testo leggibile invece che da decifrare.
In casa, tutto a bordo
Sul dispositivo per la casa i modelli sono più snelli e più veloci: l'hardware edge AI esegue il riconoscimento, la segmentazione dei parlanti e, quando serve, il riconoscimento dei suoni ambientali. Meno parametri, latenza più bassa, nessun server da raggiungere.
Non un modello solo
Accanto al riconoscimento lavorano la segmentazione dei parlanti, l'estrazione delle entità — indirizzi, numeri di telefono, importi, date — e la traduzione. Il riepilogo di fine colloquio nasce da lì.
In valutazione: Auracast
Per musei, sale conferenze e aule stiamo valutando Auracast (Bluetooth LE Audio): una sola trasmissione che chiunque può ricevere sul proprio apparecchio acustico compatibile o in cuffia, senza accoppiamenti e senza chiedere niente a nessuno.
Auracast™ è una valutazione tecnologica, non una funzione disponibile: non fa parte di quello che installiamo oggi. Auracast™ è un marchio di Bluetooth SIG, Inc.
Adattamento
Modelli ottimizzati per il contesto.
L'architettura consente l'addestramento dei modelli su domini terminologici specifici, adattando il riconoscimento al vocabolario ricorrente del contesto di installazione.
In pratica: le parole che in quel luogo ricorrono ogni giorno — moduli, procedure, denominazioni interne — vengono riconosciute meglio di quanto farebbe un modello generico.
Non pubblichiamo il modello della scheda di calcolo né il numero massimo di postazioni servite da un server: sono dati che vanno validati con un benchmark, non stimati.
Conseguenze pratiche
Cosa comporta un'architettura locale.
Nessuna dipendenza da connettività
Il servizio non si ferma quando cade la linea, e non richiede banda garantita in sede.
Nessuna condivisione con terze parti
Non esiste un fornitore esterno che riceva l'audio o il testo, quindi non esiste un contratto da fidarsi.
Latenza prevedibile
Il percorso audio-testo resta dentro la rete locale, senza andata e ritorno verso un servizio remoto.
Ecosistema espandibile
Si aggiungono postazioni e dispositivi man mano che servono, senza rifare l'impianto.