REGISTRO DE LABORATORIO / J-008 / 14–17 DE AGOSTO DE 2026
La primera cabeza integrada de Evopien ya escucha, habla, ve bajo demanda y mide de dónde procede el habla.
Este registro abarca la ventana de desarrollo verificada posterior al punto de control anterior de la web: desde el 14 de agosto a las 15:16 CEST hasta el último commit verificado del 17 de agosto a las 01:45 CEST. En ese periodo, el prototipo pasó de un ciclo de voz local funcional a una cabeza bilingüe integrada con turnos de cámara actualizados, un modo de percepción continua conservado y los primeros experimentos medidos de atención a la fuente.
El resultado es sustancial, pero acotado. Evopien puede conversar y responder localmente a preguntas visuales sobre el momento actual. Todavía no puede decidir de forma fiable cuál de varias personas cercanas tiene el turno, y el presupuesto de 8 GB de memoria unificada sigue provocando latencia y presión de intercambio a disco importantes con las configuraciones más exigentes.
Resultado actual
Qué puede hacer la cabeza ahora y dónde termina la afirmación.
La opción actual por defecto es una cabeza conversacional estacionaria. La percepción continua de alto consumo se conserva como modo independiente para el futuro movimiento, la navegación y la manipulación.
Qwen3.5-4B, Parakeet y Kokoro se ejecutan localmente en Jetson.
El AEC por hardware de XVF3800 permitió capturar durante la reproducción, interrumpir con ayuda de AEC y cancelar el flujo; no se estableció un dúplex bidireccional natural.
Los turnos normales y las interrupciones que redirigen sustancialmente la conversación pueden cambiar de idioma en ambos sentidos.
Una solicitud visual captura un JPEG actual de C920, lo adjunta al mismo turno del modelo y libera la cámara.
DeepStream 9.1, RF-DETR Medium y NvDCF funcionan juntos, pero permanecen desactivados en el lanzador por defecto de cabeza estacionaria.
Los datos de ángulo de XVF se registran como evidencia de apoyo y no pueden rechazar el habla.
Debe medirse una señal ligera de continuidad del hablante antes de activar la fusión de fuentes de audio.
La memoria persistente gobernada, la prueba completa de privacidad multiusuario y la actuación física siguen siendo hitos futuros.
Cronología
La secuencia de ingeniería del 14 al 17 de agosto.
El orden importa porque cada resultado cambió la arquitectura del siguiente experimento.
- 14 de agosto: los turnos visuales con fotogramas actuales entraron en Evopien Core
Los mensajes del modelo independientes del proveedor incorporaron partes de texto e imagen. La ruta de voz aprendió a detectar intención visual, capturar un fotograma MJPEG de 1280×720 de C920 con FFmpeg, mantener el JPEG en memoria, enviarlo mediante la API multimodal de llama.cpp y comunicar explícitamente el fallo cuando no había captura disponible. Era visión bajo demanda, no visión continua.
- 15 de agosto: se corrigió la topología acústica
La salida del altavoz se encaminó por Jetson USB → XVF3800 → AUX de 3,5 mm → Pebble V3. Esto proporciona a XVF3800 la referencia remota exacta que espera su AEC por hardware. LEFT/canal 0 se convirtió en la señal limpia de validación de voz cercana; RIGHT/canal 1 siguió siendo la señal inteligible para ASR.
- 15 de agosto: la interrupción pasó a ser conversacional, no dependiente de frases concretas
La reproducción se pausa ahora antes de la confirmación semántica cuando la señal humana limpia valida un candidato. La detección adaptativa de fin de turno clasifica el habla como control, completa, continuada o incierta mientras la captura del micrófono sigue durante ASR intermedio. Los primeros candidatos válidos se conservan en lugar de sobrescribirse con una segunda captura.
- 15 de agosto: el sistema se volvió bilingüe y empezó a responder antes
Parakeet TDT 0.6B v3 Q4_K sustituyó al punto de control Q8 de mayor tamaño; Kokoro ONNX FP16 sustituyó a la ruta PyTorch/Piper más lenta en el entorno bilingüe activo; se seleccionaron las voces inglesa
am_michaely españolaem_alex. Se validaron interrupciones sustanciales del español al inglés y del inglés al español, mientras que los controles breves conservaron intencionadamente el idioma actual. - 15 de agosto: los impactos ambientales dejaron de actuar como órdenes
Se insertó Silero VAD después del filtro de energía limpiada por hardware. Las teclas, el movimiento del ratón, las puertas y muchos golpes de cubiertos produjeron probabilidades de habla casi nulas y dejaron de pausar la reproducción. Un enclavamiento de control permitió que un Wait («espera») aceptado sobreviviese a pruebas posteriores de fin de turno vacías o ruidosas. Stop («para») sigue siendo utilizable, pero menos fiable porque los tokens ASR muy breves aún pueden corromperse.
- 16 de agosto: el margen de memoria de 8 GB se midió, no se supuso
Se evaluaron el funcionamiento sin escritorio, los servicios Snap desactivados, 2 GiB de ZRAM, una reserva de intercambio NVMe de 4 GiB, la caché Q8 K/V y un contexto Qwen de 8192 tokens. Un prompt con 6009 tokens cabía sin intercambio del proceso en la prueba aislada de Qwen, mientras que el sistema de voz completo alcanzaba un máximo cercano a 5,9 GB.
- 16 de agosto: la percepción continua de NVIDIA se hizo real
DeepStream 9.1 se integró con decodificación MJPEG por hardware de C920. YOLO26n se convirtió en el control, RF-DETR Nano se exportó y procesó, y se seleccionó RF-DETR Medium 576 FP16 con umbral 0,40, intervalo de detector 5 y seguimiento NvDCF a partir de mediciones sincronizadas.
- 16 de agosto: se separaron deliberadamente los dos modos de visión
El servicio continuo puede publicar el estado
evopien.scene.v1y un JPEG compartido en directo sin un segundo responsable de la cámara. En cambio, la cabeza por defecto mantiene RF-DETR y NvDCF desactivados, captura un fotograma nuevo solo cuando el turno hablado requiere visión y deja disponible el modo continuo demostrado para el futuro cuerpo físico. - 17 de agosto: cambió la cuantización por defecto de Qwen, pero la prueba de optimización sigue pendiente
El lanzador de la cabeza pasó de Q4_K_M con contexto de 1536 a Qwen3.5-4B UD-Q3_K_XL con contexto de 8192. La cabeza integrada arrancó y siguió funcionando, pero este punto de control no afirma que la nueva cuantización haya superado ya todos los objetivos de aceptación de memoria de 30 minutos y de resistencia.
- 17 de agosto: se probaron los datos de dirección y se impidió que se convirtiesen en una falsa autoridad
El sondeo DoA de XVF3800 se integró como telemetría en el ciclo real de conversación. Las pruebas controladas SOUTH/EAST demostraron que la dirección es útil, pero puede mantenerse errónea de forma estable durante varias muestras consecutivas. Por tanto, no se habilitó el rechazo direccional del habla.
Cabeza actual por defecto
El entorno seleccionado para la cabeza estacionaria.
Estas son las decisiones arquitectónicas activas en el punto de control final, no una lista de todos los experimentos intentados.
- Cómputo
- Jetson Orin Nano Super 8 GB · MAXN_SUPER · JetPack 7.2.1-b49 · L4T R39.2.1 · CUDA 13.2
- LLM / VLM
- Qwen3.5-4B UD-Q3_K_XL · contexto de 8192 · Q8 K/V · ejecución en GPU · sin razonamiento · proyector multimodal disponible
- ASR
- Parakeet TDT 0.6B v3 Q4_K · CPU · proceso transitorio; modo GPU rechazado tras fallos de asignación CUDA
- TTS
- Kokoro ONNX FP16 · servicio HTTP persistente · am_michael / em_alex
- Audio
- AEC por hardware de XVF3800 · validación de voz cercana LEFT · canal Parakeet RIGHT · SYS_DELAY 12 · REF_GAIN 8 · MIC_GAIN 90
- Admisión de turnos
- Validación de habla Silero · admisión de transcripciones Parakeet · fin de turno normal de 600 ms
- Visión por defecto
- Fotograma nuevo de C920 bajo demanda · RF-DETR/NvDCF continuo desactivado
- Visión conservada
- DeepStream 9.1 · RF-DETR Medium 576 FP16 · umbral 0,40 · intervalo 5 · seguimiento NvDCF
- Dirección
- Telemetría DoA de XVF3800 solo de observación; sin rechazo del habla por dirección
Evidencia medida
Las cifras de rendimiento que cambiaron el diseño.
Las cifras de componentes aislados y del sistema completo se mantienen separadas porque combinarlas crearía un presupuesto de memoria falso.
Media de unos -65,7 dB, máximo de unos -30,8 dB; se eliminó la frase remota de la señal limpia de validación.
RMS máximo de unos 0,7214; la señal limpia cercana superó ampliamente el umbral de 0,040.
2027,9 MB de RAM media, 15,0 % de GPU media, 6,62 W de media, 57,7 °C de TJ media; el seguimiento mantuvo unos 30 FPS.
6502,3 MB de RAM media, 7048 MB de pico, 197 MB de intercambio máximo, 34,4 % de GPU media, 66,2 °C de TJ máxima.
Qwen procesó un fotograma real de C920; 977 tokens de prompt + 250 de respuesta tardaron 20,39 segundos.
Se leyó un JPEG de 1280×720 y 395.212 bytes mientras DeepStream conservaba el control exclusivo de /dev/video0.
Unos 1,18–1,29 segundos frente a aproximadamente 0,06–0,12 segundos con la cámara continua compartida.
Incluye nueve pruebas nuevas de ángulo de la fuente; sin errores de compilación y con validación limpia de espacios en blanco.
Principal bloqueo del sistema
La cabeza funciona, pero la base más exigente recurría intensamente al intercambio a disco.
El análisis completo de la cabeza multimodal bajo demanda alcanzó unos 6504 MB de RAM media y 7376 MB de pico en un sistema con 7485 MB utilizables. El mínimo de MemAvailable cayó a unos 16,2 MB, el intercambio alcanzó un pico de unos 2,70–2,73 GB y el máximo de escritura a intercambio llegó a unos 577.512 KB/s. No es un uso inocuo de la reserva; es intercambio excesivo de memoria y contribuye directamente a la latencia conversacional.
Las pruebas de Parakeet en CPU oscilaron entre unos 1,8 y 7,8 segundos, a veces por encima de 10 segundos, y los turnos con varias pruebas podían superar los 15 segundos. Se rechazó Parakeet en GPU tras fallar asignaciones de memoria unificada de unos 396 MiB. Las respuestas largas de Kokoro también podían requerir 10–18 segundos de síntesis. El texto de Qwen por sí solo solía ser mucho más rápido cuando no dominaba la presión de memoria.
Resultado negativo decisivo
La dirección de llegada no puede identificar por sí sola al hablante.
Catalin, hablando desde la posición SOUTH del banco de pruebas, produjo lecturas muy estables alrededor de 158°, con probabilidades Silero cercanas a 0,99–1,00. Un segundo hablante situado físicamente en EAST se siguió inicialmente alrededor de 103°, 81°, 73°, 69° y 68°.
Durante el mismo tramo del hablante EAST, XVF informó después de un grupo sostenido de valores similares a SOUTH: 170°, 184°, 191° y repetidos 192°, antes de volver hacia EAST. El problema no era, por tanto, una muestra errónea aleatoria. Las reflexiones de la sala, los múltiples trayectos acústicos o el estado del formador de haz pueden crear varios ángulos consecutivos estables, pero físicamente incorrectos.
Límites conocidos
Lo que este hito no demuestra.
No se ha seleccionado un modelo de representación vectorial de hablantes ni un umbral de similitud para producción.
El perro, el bebé, la televisión y otras personas pueden seguir creando ambigüedad contextual incluso cuando se filtran los impactos que no son habla.
Parakeet sigue siendo transitorio y contribuye de forma importante a la latencia.
Procesos obsoletos de llama-server provocaron un agotamiento de memoria al arrancar; hay que reforzar la detección de caída de servicios y la limpieza de procesos hijos.
El modelo local 4B puede inventar hechos y detalles visuales; la recuperación y la verificación siguen siendo trabajo futuro.
El contexto temporal de sesión no es el sistema de memoria selectivo, consultable y separado por privacidad definido por Foundation.
El ESP32 existe, pero no se ha integrado ningún protocolo de motores, supervisor de seguridad, controlador de articulaciones ni hito de acción física.
Material de demostración
Ver la cabeza integrada en funcionamiento en este punto de control.
Esta demostración grabada muestra las capacidades funcionales de entrada y salida de voz y visión documentadas en J-008. Complementa el registro de ingeniería medido anterior; no amplía el hito más allá de sus límites declarados.
Interacción local integrada de audio y visión en la plataforma Jetson de desarrollo de la cabeza.

