Avatar conversacional con voz e resposta visual coordinada
Unha representación virtual con coñecemento autorizado, entrada por voz, resposta falada e unha secuencia visual que acompaña a intención e duración de cada frase.
Que cambiou
A identidade virtual responde con coherencia verbal, sonora e visual
A experiencia deixa de ser un vídeo decorativo cun cadro de texto. Voz, contido e xesto responden como partes dun mesmo sistema, cunha fronteira clara entre a representación virtual e a persoa real.
- Entrada
- Voz ou texto
- Saída
- Resposta, audio e secuencia de vídeo
- Control
- Coñecemento limitado e fallback local
Da orixe ao resultado
Etapas do sistema
As decisións de implementación e o stack concreto compártense unicamente en reunións privadas.
- 01EscoitaMicrófono ou texto do visitante
- 02CriterioCoñecemento autorizado e límites
- 03VozTranscrición e síntese
- 04EscenaCola de clips segundo intención e duración
O reto
Non abondaba con poñer un chatbot ao lado dun vídeo
A experiencia debía sentirse cercana sen atribuír ao avatar información que non coñece. Ademais, o tempo de resposta, a gravación do micrófono, a síntese de voz e os cambios de vídeo debían coordinarse para non producir silencios, saltos ou xestos incoherentes.
Preguntas sobre menús, prezos, reservas ou datos privados tiñan que quedar fóra do ámbito, e os intentos de cambiar as instrucións do personaxe non podían contaminar a resposta.
A solución
Conversa, voz e posta en escena coordinadas en tempo real
O modelo conversacional recibe unha base de feitos autorizados, límites e un historial curto. O controlador filtra entradas, detecta intentos de cambiar as instrucións, limita o uso e ofrece respostas locais de respaldo se un provedor deixa de estar dispoñible.
Un servizo transcribe o audio e outro sintetiza a voz. No navegador, a resposta divídese en frases e constrúe unha cola de clips semánticos sincronizados coa duración real do audio.
Capacidades
Que resolve o sistema
- Entrada escrita ou gravación de voz con formatos compatibles.
- Transcrición e síntese de voz configuradas para a experiencia.
- Identidade e coñecemento acotados, con negativa para ámbitos non dispoñibles.
- Detección de intentos de alterar instrucións e validación da petición.
- Respostas locais de respaldo ante fallos de provedores externos.
- Montaxe dinámica de clips semánticos sincronizado co audio xerado.
Resultado operativo
A identidade virtual responde con coherencia verbal, sonora e visual
A experiencia deixa de ser un vídeo decorativo cun cadro de texto. Voz, contido e xesto responden como partes dun mesmo sistema, cunha fronteira clara entre a representación virtual e a persoa real.