2–5 de septiembre / J-013
De un ciclo de voz a una conversación con contexto visual.
Esta actualización revisa 235 commits posteriores a J-012: control bilingüe de sesión, preguntas largas, percepción en directo, fundamentación en la imagen actual y experimentos con vídeo reciente.
La última rama proporciona a cada turno normal de Qwen una selección visual de los 15 segundos anteriores. Esa implementación es una versión candidata pendiente de verificación física.

Qué cambió
Cuatro líneas de trabajo conectadas.
Una conversación que mantiene el hilo
Las preguntas largas, los seguimientos breves, las respuestas interrumpidas y los cambios explícitos de idioma cuentan ahora con un tratamiento específico. Core mantiene el control de la sesión.
Una cámara con reloj
La recuperación de la captura, las marcas de tiempo y la distinción entre el estado actual y obsoleto de la escena permiten diferenciar una observación reciente de una antigua.
Voz y percepción comparten Thor
La detección se adapta a la carga de trabajo de la conversación. El seguimiento pasa a PVA para competir menos con Qwen por la GPU.
Contexto visual reciente
La fundamentación en la imagen actual cuenta con evidencias físicas. La última implementación de contexto de vídeo de 15 segundos está preparada para una nueva prueba de verificación.
MS-08 / Conversación
La estabilidad consiste en conservar el contexto correcto.
Después de CP09-I, el trabajo abordó marcadores de razonamiento mal formados, transcripciones especulativas que ya no coincidían con lo pronunciado y la renovación del historial que podía eliminar el contexto necesario para una pregunta de seguimiento. El contexto de trabajo reparado conserva intercambios completos. Un arrastre acotado a dos intercambios y 1.800 caracteres mejoró la preparación previa sin tratar la caché del modelo como memoria permanente.
Una prueba de 50 turnos solo con Qwen mantuvo las medianas de sus cinco bloques de tiempo hasta el primer token en torno a 228–231 ms. Las comprobaciones semánticas superaron automáticamente 24 de 25 casos; la revisión manual concluyó que la respuesta restante era correcta y que el evaluador por palabras clave era demasiado restrictivo. Esto respalda la política de contexto probada durante esa ejecución. No demuestra una memoria de por vida.
El habla larga se mantiene ahora como un único turno de Core a lo largo de bloques de transcripción acotados. Se probaron preguntas completas de 6,6 y 9,8 segundos sin clasificarlas erróneamente como entrada prolongada solo por su duración. Los seguimientos breves, como «Why?» («¿Por qué?»), y sus equivalentes en español también recibieron un tratamiento explícito.
Se rechazaron varios enfoques alternativos. La decodificación especulativa aumentó los tokens por segundo, pero no cumplió el criterio de mejora neta de la primera respuesta, por lo que no sustituyó a la base física. El tratamiento de entradas largas específico para relatos falló las pruebas de activación y dio paso a un modelo general del turno de palabra del usuario.
CP09-S hizo determinista la generación y excluyó del siguiente prompt los fragmentos iniciales interrumpidos del asistente, conservando el registro canónico de la conversación. CP09-W añadió después el cambio explícito mediante voz entre inglés y español de España en la misma sesión, también tras una interrupción confirmada. Core reconoce una gramática finita de órdenes y da una confirmación local sin pedir a Qwen que decida el idioma.
La ejecución conservada probó cuatro cambios correctos, dos de ellos durante el habla activa, con 504 comprobaciones superadas y un cierre limpio en reposo. Demuestra que el cambio explícito funciona dentro de esa prueba. La identificación automática de idioma y el habla con varios idiomas en un mismo enunciado siguen siendo trabajos independientes.
Tiempos / Mantener separadas las mediciones
Sin nuevas afirmaciones generales de latencia.
La referencia de respuestas normales que aparece a continuación procede de CP09-S. La muestra posterior de CP09-W combina respuestas de Qwen con cuatro confirmaciones locales rápidas de cambio de idioma, por lo que su mediana no es un dato representativo justo para la conversación general.
| Prueba registrada | Resultado | Qué mide |
|---|---|---|
| Voz CP09-S | 1,524 s P50 1,803 s P95 | Desde el final detectado del habla hasta el primer PCM generado. No es una medición acústica independiente del momento en que se oye la respuesta. |
| CP09-S Qwen | 194,2 ms P50 207,0 ms P95 | Tiempo hasta el primer token, con 20 muestras de Qwen. El tiempo del modelo es solo una parte de la latencia de respuesta. |
| Confirmaciones de idioma de CP09-W | 782–1.148 ms | Respuestas de control locales que no pasan por Qwen. La ejecución mixta de siete respuestas no es directamente comparable con respuestas normales. |
| Imagen actual de 640×480 | 351,9 ms TTFT | Tiempo del modelo visual hasta el primer token en una prueba física. La generación completa de 547 caracteres tardó 11,852 segundos; no se midió el inicio integrado de voz y visión. |
El objetivo vigente de voz de ≤1,3 segundos P95 no se ha superado. La mediana anterior de 1,3705 segundos de J-012 sigue siendo un resultado fechado de ocho respuestas, no el dato principal actual ni una promesa de que cada respuesta sea más rápida.
MS-09 / Captura y coexistencia
Ver de forma continua sin dejar sin recursos a la conversación.
La C920 podía caer a unos 15 FPS al restablecerse el control de frecuencia dinámica de fotogramas. Volver a aplicar ese control y leer su valor restauró unos 30,92 FPS antes y después de reconectar el USB. Una prueba independiente con el reloj del kernel midió 29,89 FPS y una antigüedad del último fotograma de 24,216 ms; después demostró la transición de actual a obsoleto. Ese resultado del reloj de captura todavía no demuestra la actualidad de todas las imágenes semánticas enviadas a Qwen.
La ruta de percepción conecta ahora captura de cámara, detección RT-DETR, seguimiento NvDCF y metadatos de escena tipados. Core controla cuánto trabajo se admite. Los ritmos fijos del detector a 30, 15 y 10 FPS perjudicaron el rendimiento de voz; la versión candidata adaptativa cambia su intervalo de 2 a 32 durante la generación y vuelve a 2 después, mientras la captura y el seguimiento se mantienen cerca de 30 FPS.
Trasladar el seguimiento NvDCF de CUDA a PVA redujo la competencia por recursos en la comparación aislada. La mediana desde la solicitud de Qwen hasta el inicio fue de 712,2 ms con PVA, frente a 844,9 ms con CUDA y 696,9 ms sin percepción. El diagnóstico de PVA también procesó 3.590 fotogramas a 29,91 FPS sin metadatos inválidos. Son diagnósticos de coexistencia, no resultados desde el final del habla hasta la respuesta audible ni un criterio full-duplex superado.
Fundamentación en la imagen actual
El modelo Qwen residente puede recibir la imagen de la cámara.
El puente de imagen actual captura un JPEG de la misma ruta de cámara y lo entrega mediante un intermediario multimedia acotado en memoria. Un intento de usar un servicio separado Qwen3-VL 8B FP8 falló por un problema de compatibilidad de DeepGEMM con Thor antes de ejecutar una solicitud de imagen. Fue un fallo del entorno de ejecución, no una comparación de calidad de modelos.
La siguiente prueba utilizó la interfaz multimodal nativa del modelo Qwen3.8 residente. A 256×256, interpretó incorrectamente a una persona de un collage del fondo como otra persona físicamente presente en la sala. Una imagen completa de 640×480 corrigió esa interpretación de la escena en la prueba física conservada. Después se realizó un experimento de captura a 720p. El seguimiento también reforzó las instrucciones de fundamentación, por lo que este resultado no aísla únicamente la resolución. La precisión visual general y los tiempos de respuesta de voz y visión siguen sin verificarse.
Vídeo reciente / Resultados y siguiente versión candidata
Recibir vídeo no es lo mismo que comprender el movimiento.
Los clips de dos segundos y cuatro fotogramas y de cuatro segundos y ocho fotogramas llegaron al modelo y produjeron texto, pero ambos fallaron la prueba de movimiento prevista. El primer texto llegó aproximadamente a los 751 ms y 1.245 ms, respectivamente. Los diagnósticos posteriores de imágenes de los extremos y de resolución tampoco superaron los criterios de movimiento.
La propia prueba tenía problemas: su primer fotograma seleccionado llegaba unos 540 ms después de la señal de movimiento y la formulación izquierda/derecha era ambigua entre la perspectiva de la cámara y la del operador. Por tanto, la evidencia no permite establecer que el modelo sea incapaz de razonar temporalmente. Se implementó una prueba de movimiento calibrada para separar una prueba defectuosa de una limitación del modelo.
CP07 mantiene una ventana móvil en RAM a 4 FPS, con capacidad para 61 fotogramas JPEG. Selecciona 16 fotogramas mediante ocho muestras uniformes y ocho picos de cambio, construye un MP4 de 640×360 en memoria y lo adjunta a cada turno normal de Qwen. Las órdenes de control locales y la preparación previa de la caché siguen sin incluir medios.
Esto cambia el plan anterior, limitado a solicitudes bajo demanda. La versión candidata busca admitir preguntas sobre acciones recientes habituales sin una frase especial de solicitud visual. La calidad física, el comportamiento ante interrupciones, el uso de recursos y la latencia integrada de voz y vídeo aún requieren verificación.
La ventana es procesamiento visual temporal, no memoria permanente. Las imágenes y clips sin procesar se gestionan en RAM, sin archivos multimedia con nombre en esta ruta. Core sigue siendo responsable de la admisión, la actualidad y la limpieza. La versión candidata adjunta contexto durante una sesión activa; no autoriza una conservación indefinida.
Estado del proyecto
Conservar las bases funcionales. Verificar el sistema combinado.
- Mantener CP09-W como base congelada de voz bilingüe explícita y CP05 como punto de reversión conservado de voz y percepción.
- Ejecutar la versión candidata de 15 segundos en Thor con acciones calibradas, respuestas fundamentadas y tiempos medidos de extremo a extremo.
- Cerrar los criterios pendientes de solapamiento, cancelación, recuperación y latencia P95. Sigue registrado un fallo de limpieza de cierre y procedencia durante la reproducción reanudada de WAIT/CONTINUE.
- Continuar los trabajos de memoria gobernada, relaciones e internet a través de sus propios criterios de aceptación antes de Alpha o de un cuerpo con movimiento motorizado.
MS-08 y MS-09 siguen en curso y bloqueados en sus criterios formales de aceptación. Core, cognición, procesamiento visual y voz se ejecutan en local; el reconocimiento de voz también utiliza el servicio residente Cohere Transcribe localmente en Thor.
Referencias de ingeniería y fecha de cierre de la revisión
Base del sitio web: v1.6.0, commit 39272e79837fa51147d4e9c7181d123df3c3c2d7. La comparación de ingeniería comienza después de b4d7212f827006578c628c380f10435757777f31; J-012 ya cubría la estructura inicial de CP09-J.
- Ejecutable congelado de CP09-W
b3717d20f454a19bba2f140dbb5886546d9fed3c- Reversión conservada de CP05
5ff20fd9afd22f697c29962f15b3ed0f31ca748f- Prueba física de imagen actual
60784517· CP06-B, 640×480- Último registro de implementación revisado
443db7f53e623983842917568ab25b0dce44caea· CP07, registrado el 4 de septiembre a las 22:32 UTC / 5 de septiembre en España
Evidencias: registros de congelación de CP09-S y CP09-W; informes físicos de CP09-Q2/S; plan de sesión en directo de CP09-O; registros físicos de MS09 CP02/03; ADR-0038/0039/0040; registros experimentales de CP06-B/D/E/F/G; y registro de implementación de 15 segundos de CP07. Los nombres de los puntos de control identifican el alcance de las evidencias; una rama congelada no equivale a superar formalmente un hito.

