REGISTRO DE LABORATORIO / J-009 / 17–20 DE AGOSTO DE 2026
Evopien ya tiene una base de voz que merece conservarse.
Este registro recoge el trabajo de ingeniería posterior al último commit de la web del 17 de agosto de 2026 a las 16:22 CEST. La ruta de voz de Orin en ese punto de control alcanzó una respuesta física limpia representativa de unos 2,15 segundos desde el final del habla del usuario hasta el primer audio significativo. El turno más rápido observado en la evidencia conservada fue de unos 1,51 segundos.
Estas cifras no deben reducirse a una garantía de 1,5 segundos. Los turnos físicos correctos siguen variando, y el punto de control maestro congelado describe un intervalo limpio habitual de unos 2,0 a 2,7 segundos. Por tanto, el hito público fiel a los resultados es de unos dos segundos, con 1,51 segundos registrados como el mejor turno observado, no como el máximo habitual.
Resultado actual
Qué está congelado, activo y aún pendiente.
Voice controla la entrada y salida acústicas. Conversational Presence es un subsistema activo independiente que decidirá los tiempos sociales sin cambiar la base de voz congelada.
La captura y reproducción simultáneas locales y bilingües, la detección de fin de turno, el primer audio significativo, la voz en flujo continuo y la interrupción asistida por AEC de hardware formaron la base experimental congelada de Orin.
Resultado físico limpio representativo tras el final del habla del usuario. El turno más rápido observado y conservado fue de unos 1,51 s; no es una garantía.
Parakeet TDT 0.6B v3 Q4_K se ejecuta como proceso persistente en CPU con seis hilos; la mediana con el mismo WAV fue de unos 0,297 s.
Piper con INT8 selectivo utiliza Amy Medium para inglés y Claude High para español, con unos 166 MB de RSS y aproximadamente 0,20 s de síntesis para segmentos iniciales breves habituales.
Qwen3.5-4B UD-Q3_K_XL se ejecuta mediante llama.cpp con razonamiento desactivado, contexto de voz de 4096, Q8 K/V y precalentamiento obligatorio de la caché de prompts.
El estado de turno, las pausas para pensar, la cesión de palabra y las señales de escucha se evalúan por separado de Voice V1.
No se habilitaron señales de escucha mhm, mm-hm o uh-huh en el entorno de ejecución de Orin.
La dirección de llegada sigue siendo solo de observación y no se afirma una atribución robusta del turno en una sala familiar.
La memoria selectiva gobernada, la prueba completa de privacidad multiusuario, la actuación facial o de cabeza y el movimiento físico siguen siendo hitos futuros.
Secuencia de ingeniería
Qué cambió después de J-008.
El trabajo no consistió en un único cambio de modelo. Se fue acotando de forma medida toda la ruta de respuesta hasta que la latencia restante dejó de justificar la desestabilización del subsistema.
- Se definió fielmente el límite de respuesta
El tiempo se mide desde el final físico del habla del usuario hasta la primera respuesta acústica con significado real. No cuenta contenido de relleno como espera, déjame pensar ni una señal sintética añadida solo para detener el cronómetro.
- Parakeet se convirtió en un servicio persistente de seis hilos
El reconocimiento Q4_K en CPU se mantuvo dentro del margen de memoria de 8 GB mientras la mediana con el mismo WAV bajó de unos 0,764 s con dos hilos a unos 0,297 s con seis. Se siguió descartando ASR en GPU porque no se justificaba su riesgo para la memoria unificada.
- La detección de fin de turno dejó de permitir que el ruido aleatorio controlase el tiempo
La pausa normal siguió siendo de unos 0,60 s, pero la ruta de captura solo actualizaba la hora final del habla con habla validada después de abrirse el turno. El ruido ambiental dejó de prolongar un turno por el mero hecho de superar un umbral de energía bruta.
- Se probaron y seleccionaron candidatos de TTS en inglés y español
Scylla, Pocket y otras alternativas revelaron compromisos útiles entre velocidad y calidad, pero ningún sistema mixto justificó seguir cambiando modelos. Piper con INT8 selectivo, Amy Medium y Claude High se convirtió en la base bilingüe definitiva de Voice V1.
- Se analizó Qwen más allá de los tokens por segundo
La caché de prompts eliminó unos 2,6 a 2,8 segundos de la evaluación del prompt en frío. El proyector multimodal residente añadió unos 55 MB de PSS y prácticamente ninguna latencia de texto medida. El tamaño de lote, el tipo K/V, las frecuencias fijadas y la profundidad de contexto produjeron solo pequeñas mejoras.
- Se rechazaron atajos de latencia cuando perjudicaban al producto
Las rutas especulativas de ventana móvil alcanzaron aproximadamente 1,26 a 1,68 s, pero eran frágiles. Forzar primeras frases ultracortas podía alcanzar unos 1,11 a 1,64 s, pero degradaba la calidad de la respuesta y manipulaba la métrica. Ninguna opción entró en la base congelada de Voice V1.
- El resultado físico final de voz alcanzó un nivel suficiente
Los turnos recientes representativos en directo se agruparon en torno a 1,95, 2,12 y 2,18 segundos, con una media de unos 2,08 segundos. El punto de control maestro congelado registra una mediana representativa cercana a 2,15 segundos y un intervalo limpio habitual de unos 2,0 a 2,7 segundos.
- Voice V1 se etiquetó y congeló
La batería alcanzó 233 pruebas superadas más dos subpruebas. Se superaron la sintaxis de Bash, la compilación de Python y la validación de espacios en blanco. Seguir ajustando la voz requiere ahora un fallo concreto del prototipo físico o un cambio de requisito del producto.
- Conversational Presence se convirtió en la rama activa
El siguiente problema no es simplemente hablar antes. Es decidir si el silencio significa que la persona ha terminado, está pensando o va a continuar, y si una señal sutil puede mostrar atención sin tomar la palabra.
Base congelada de Orin
Voice V1 en el Jetson de 8 GB.
Estas eran las opciones elegidas en ese punto de control. Los detalles anteriores de J-008 siguen siendo históricamente correctos para su fecha, pero ya no describen el ciclo de vida activo de TTS o ASR.
- Cómputo
- Jetson Orin Nano Super 8 GB · MAXN_SUPER · Ubuntu 24.04.4 · JetPack 7.2.1-b49 · CUDA 13.2
- LLM / VLM
- Qwen3.5-4B UD-Q3_K_XL · llama.cpp · ejecución en GPU · contexto de voz de 4096 · Q8 K/V · razonamiento desactivado · proyector multimodal residente
- ASR
- Parakeet TDT 0.6B v3 Q4_K · proceso nativo persistente en CPU · seis hilos · canal RIGHT de XVF
- TTS
- Piper con INT8 selectivo · Amy Medium en inglés · Claude High en español · primer segmento cercano a 48 caracteres más margen
- Audio
- AEC por hardware de XVF3800 · validación de habla LEFT · ASR RIGHT · reproducción Pebble V3 · interrupción y cancelación de flujo asistidas por AEC de hardware
- Fin de turno
- Pausa normal de aproximadamente 0,60 s · temporización de habla validada · sin prolongación por ruido aleatorio
- Visión por defecto
- Fotograma nuevo de C920 bajo demanda · proyector multimodal residente · RF-DETR/NvDCF continuo desactivado
- Visión conservada
- DeepStream 9.1 · RF-DETR Medium 576 FP16 · umbral 0,40 · seguimiento NvDCF · modo validado independiente
Tiempos medidos
El hito de dos segundos, sin ocultar su variación.
Los tiempos de los componentes explican la arquitectura, pero solo la temporización física de extremo a extremo respalda la afirmación de respuesta al usuario.
Mejor tiempo observado hasta el primer audio significativo en la evidencia conservada de 18 turnos; no es el resultado representativo.
Unos 1,95 s, 2,12 s y 2,18 s tras reforzar el prompt de respuesta directa y completar la ruta final de voz.
Desde el final físico del habla hasta el primer audio significativo en turnos limpios en serie; los turnos normales correctos fueron de unos 2,0 a 2,7 s.
La confirmación del fin de turno, la finalización del WAV y ASR consumen la mayor parte del tiempo antes de que Qwen pueda comenzar.
Mediana representativa de la primera frase en caliente del perfil conservado de Qwen, incluido el tiempo hasta el primer token.
Segmento inicial breve habitual en la ruta congelada de Orin con INT8 selectivo.
Decisión de ingeniería
Una cifra de rendimiento menor ya no es la tarea de mayor valor.
Q4_K_M decodificó aproximadamente un 11,6 % más rápido que Q3 de forma aislada, pero el ahorro previsto hasta el audio inicial era de solo decenas de milisegundos. Los lotes mayores ahorraron unos nueve milisegundos. Fijar las frecuencias de Jetson añadió calor a cambio de una mejora de decodificación de aproximadamente un cuarto de punto porcentual. Nada de esto cambia la interacción tanto como unos tiempos de turno correctos.
Una respuesta de voz significativa en menos de un segundo requeriría un solapamiento seguro entre ASR en directo, la confianza en el final de turno, Qwen especulativo y TTS. Sigue siendo una arquitectura futura legítima, pero no se justifica mientras Voice V1 ya cumpla el requisito del prototipo actual y sigan sin terminar sistemas importantes del robot.
Subsistema activo
Presence controla los tiempos sociales, no la respuesta.
El objetivo es que Evopien se perciba realmente presente: escuchando, esperando cuando corresponde, dando señales de atención con cuidado y respondiendo en el momento social adecuado.
El usuario sigue hablando o ha dejado claramente la frase abierta. Evopien permanece en silencio.
El silencio no supone automáticamente una cesión de palabra. El usuario puede seguir teniendo el turno.
Un futuro sonido en caché como mhm o un asentimiento visual sutil puede mostrar atención sin estar de acuerdo con el contenido ni finalizar el turno.
El usuario ha cedido el turno y Voice V1 congelada puede generar la respuesta real.
Un sonido humano como mhm, sí o vale mientras Evopien habla no debería provocar siempre una interrupción.
Punto de control de detectores de turno
Dos detectores locales pequeños caben en el sistema. Ninguno se ha ganado el control del turno.
Smart Turn v3.2 y LiveKit v1-mini se ejecutan en Jetson con un coste de inferencia aceptable. Smart Turn utilizó unos 176 MB de RSS máximo y posteriormente funcionó con una mediana cercana a 88 ms. LiveKit utilizó unos 359 MB de RSS máximo y una mediana cercana a 85 ms. Ambos superaron la viabilidad de cómputo.
En un corpus guiado de estrés deliberadamente difícil, en el punto de decisión de 600 ms, Smart Turn produjo 21 falsas interrupciones en 23 eventos HOLD; LiveKit produjo 23 de 23. Un umbral suficientemente estricto para eliminar las falsas interrupciones provocó 39 esperas innecesarias en 41 eventos END con cualquiera de los detectores.
Límites de la evidencia
Lo que este hito no afirma.
1,51 s es la observación más rápida conservada. El funcionamiento limpio representativo es de unos 2,15 s y los turnos más difíciles pueden tardar más.
Se definieron la arquitectura y la ruta de evaluación, pero las señales de escucha y su influencia sobre el control del turno no se habilitaron en el entorno de Orin.
Una señal neutral de escucha nunca debe presentarse como acuerdo, verificación factual ni aprobación de seguridad.
Presence no puede inventar turnos del usuario, escribir memoria a largo plazo, eludir la gobernanza ni emitir órdenes directas a motores.
La gobernanza, la memoria selectiva, la privacidad doméstica, el rostro y la mirada, el movimiento, la manipulación y el cuerpo físico en el mundo real siguen incompletos.

