REGISTRO DE THOR / J-012 / 02 DE SEPTIEMBRE DE 2026
La ruta de voz ya funciona de extremo a extremo. El criterio de aceptación sigue sin superarse.
J-011 terminó con componentes independientes en tiempo real y un plan de integración. Cinco días después, la última ruta de Thor probada físicamente abarca desde el micrófono XVF3800 hasta la formación de turnos, la admisión de transcripciones, el estado de conversación controlado por Core, Qwen3.8, la voz de Scylla y un único responsable de reproducción física.
En la última prueba de ocho respuestas, la mediana desde el final detectado del habla hasta el primer PCM generado fue de 1,3705 segundos. Es una mejora sustancial respecto al intervalo aproximado de 2,2–2,6 segundos para respuestas nuevas de la congelación CP01 del 31 de agosto, pero no es un resultado de fiabilidad ni equivale a una medición acústica independiente del momento en que se oye la respuesta.
Último punto de control físico
Qué mide realmente el resultado de 1,37 segundos.
Estas estadísticas proceden de la prueba física CP09-I en el commit 64df168f4a8711a07def4f598e91f30f35f9e46b. Las distintas métricas tienen conjuntos de muestras diferentes y no deben sumarse como si formasen una única traza determinista.
- Fin del habla → primer PCM · P50
- 1,3705 sOcho respuestas físicas
- Fin del habla → primer PCM · P95
- 1,7971 sNo supera el criterio de ≤1,3 s
- Qwen TTFT · P50
- 211,8 msQwen3.8 / SGLang local
- TTFT de turnos posteriores · P50
- 212,5 msSin la antigua caída de rendimiento de caché en esta prueba
- Confirmación definitiva · P50
- 499,3 msOnce decisiones de turno
- Primer token → unidad de voz · P50
- 399,8 msSegmentación local de frases seguras
- 01Finalizar el turnoConfirmación definitiva P50 · 499,3 ms
- 02Iniciar la cogniciónQwen TTFT P50 · 211,8 ms
- 03Formar voz seguraDespués del token P50 · 399,8 ms
- 04Sintetizar PCMEjemplos de Scylla · aproximadamente 0,28–0,38 s
Las respuestas breves y naturalmente completas alcanzaron unos 1,02–1,19 segundos. Las respuestas normales y más largas solían mantenerse alrededor de 1,5–1,8 segundos porque la formación de frases útiles y el inicio de voz, no solo el primer token de Qwen, dominan ahora la parte variable de la ruta.
29 de agosto → 2 de septiembre
Cinco días de integración controlada, fallos y simplificación.
El resultado no surgió de un único cambio de modelo. Cada punto de control aisló una capa de fallo distinta y conservó la evidencia útil incluso cuando se rechazó el candidato.
El reconocimiento persistente, un banco de pruebas de latencia dúplex, las reparaciones de fiabilidad de turnos y reproducción y las comprobaciones de salud al arrancar convirtieron el plan modular en una ruta física medible.
ConversationLedger asumió el control canónico del historial hablado, las concesiones de generación, WAIT, CONTINUE, STOP, la salida obsoleta y la exclusión de contenido generado pero no oído. Los controles en español de España funcionaron en la prueba final, con un fallo Espera → Espero conservado en el registro.
Los grafos de decodificación elevaron la salida normal de Qwen a unos 13,3 tok/s. Las pruebas de segmentos naturales rechazaron los cortes temporizados arbitrarios, y la medición directa reveló una fuerte competencia por la GPU entre la decodificación continuada de Qwen y la síntesis de continuación de Magpie/NanoCodec.
Smart Turn se solapó con Cohere Transcribe sin ceder la autoridad de turnos de Core: se reutilizaron 15/15 solicitudes especulativas sin espera al confirmar el turno. La misma prueba de 15 turnos reveló crecimiento del TTFT de Qwen al avanzar la sesión.
Desplazar el historial del modelo eliminando su inicio destruyó la reutilización de la caché de prefijos de SGLang. La memoria de sesión abierta de Core se separó de una época acotada del contexto de trabajo de Qwen que solo añade contenido, con precalentamiento explícito.
La arquitectura con caché estable se incorporó a la cabeza en directo. Los experimentos de completitud, arranque, calidad bilingüe y respuestas por etapas revelaron nuevos problemas; CP09-I eliminó el protocolo de voz dirigido al modelo y volvió a un único flujo natural de Qwen.
Última ruta probada físicamente
Una respuesta gobernada, una generación natural y un responsable de reproducción.
El último punto de control ya no es el plan de componentes Nemotron/DualTurn/UltraVAD/Magpie descrito en J-011. La ruta probada cambió a medida que las mediciones descartaron candidatos débiles.
- 01Límite físico de audioAEC por hardware de XVF3800 + Creative Pebble V3Prueba en Thor
LEFT transporta evidencia de voz cercana e interrupción; RIGHT transporta el habla semántica. La prueba independiente de AEC en Thor sigue siendo la base de hardware aceptada.
- 02Formación de turnosEvidencia acústica de voz cercana + Smart TurnRuta física
La temporización local determinista conserva la autoridad del turno de palabra. Smart Turn indica si la intervención parece completa; no confirma por sí solo un turno del usuario.
- 03TranscripciónSolapamiento especulativo de Cohere TranscribeExperimental
El reconocimiento comienza antes de la confirmación definitiva y solo se reutiliza tras una admisión acotada. Corrección del 5 de septiembre: Cohere Transcribe se ejecuta localmente en Thor mediante un servicio residente; el texto anterior describía incorrectamente esta ruta ASR como no local.
- 04Autoridad conversacionalEvopien Core + ConversationLedgerControlado por Core
Core controla la admisión del usuario, el historial de lo pronunciado, WAIT/CONTINUE/STOP, la cancelación, los puntos de control, la audibilidad y las concesiones de generación.
- 05Contexto de sesiónMemoria derivada de sesión abierta + época acotada de QwenCaché estable
La evidencia canónica de sesión permanece fuera de la caché del modelo. Qwen recibe un contexto de trabajo acotado que solo añade contenido, con cambios de época precalentados, en lugar de desplazar el inicio del historial.
- 06Cognición localDecodificación normal sin razonamiento de Qwen3.8-27B R8.1Probado en Thor
El control conservado de SGLang mantiene la rapidez del primer token. Los entornos alternativos no lo desplazaron para el inicio de voz.
- 07Inicio de vozSegmentación local de prefijos seguros de 4–6 palabrasUn único flujo
Una respuesta breve naturalmente completa puede emitirse de inmediato; en los demás casos, la capa de voz, no Qwen, espera un pequeño prefijo sintácticamente seguro mientras continúa la misma generación.
- 08Voz + reproducciónScylla INT8 CPU + un único responsable de reproducción ordenadaRuta física
La voz en CPU evita el mecanismo medido de competencia entre Qwen y el códec en GPU. El texto no oído y el PCM obsoleto deben perder su autoridad al cancelar.
El fallo en sesiones largas
Una ventana de conversación mayor solo desplazó la caída de rendimiento.
CP08 comenzó con un TTFT de Qwen cercano a 228,6 ms y alcanzó 681,0 ms después del quinto turno. CP09-A vinculó el salto a la primera expulsión del inicio del historial visible para el modelo: se desplomó la reutilización del prefijo en caché y fue necesario volver a cargar todo el prompt.
Ampliar la ventana de cuatro a 32 intercambios no lo resolvió. Posponía el mismo fallo hasta el turno 34, donde el TTFT subió a 1,849 segundos y los turnos posteriores se mantuvieron en torno a 1,685 segundos P50.
Congelación del ciclo de vida de Core
Solo lo que realmente se oyó se convierte en verdad conversacional.
No se permitió que el trabajo de latencia eludiese el registro de conversación. Una respuesta más rápida no es aceptable si el texto cancelado o no oído contamina el contexto posterior.
WAIT crea un punto de control real y reanudable. CONTINUE recibe una nueva concesión gobernada. STOP limpia sin contenido de relleno. Las unidades del asistente solo se vuelven canónicas después de ser audibles, y la salida obsoleta del proveedor se rechaza cuando cambia el responsable.
En una interrupción distinta de WAIT, la memoria canónica conserva el prefijo exacto pronunciado. Solo el contexto de trabajo desechable del modelo puede marcar ese prefijo como interrumpido, evitando que Qwen confunda una respuesta cortada con una deliberadamente completa.Qué descartaron los experimentos
La ruta activa es más acotada porque se midieron las alternativas.
Aquí, rechazado significa descartado para la función actual de inicio de voz bajo las restricciones probadas en Thor. No significa que el trabajo carezca de valor para investigación futura.
Los grafos de decodificación mejoraron el tiempo por token aproximadamente un 35–38 %, alcanzando unos 13,3 tok/s con TTFT en caliente del orden de 233–240 ms P95.
El RTF P95 de NanoCodec empeoró de 0,188 en reposo a 1,552 durante la decodificación de Qwen: una degradación de 8,236× en el caso de competencia por recursos probado.
Trasladar NanoCodec a ocho núcleos de CPU evitó la competencia medida por la GPU y lo convirtió en el mejor candidato de continuación de Magpie, pero el tiempo de primera respuesta siguió siendo peor y la ruta práctica Qwen + Scylla lo desplazó.
Evita la ruta específica de competencia con el códec en GPU y produjo el primer PCM de segmentos breves normales aproximadamente en el intervalo de 0,3–0,4 segundos.
La síntesis en inglés y español funcionó, pero el tiempo útil hasta el primer audio en caliente siguió siendo de varios segundos y algunos flujos solo emitieron fragmentos.
Se compiló y ejecutó en Thor con un buen rendimiento de procesamiento inicial del prompt, pero una decodificación de unos 12,3 tok/s no mejoró la ruta conversacional activa.
Alcanzó 24,62 tok/s en una generación larga en español, pero el TTFT conversacional y la latencia hasta la primera frase fueron peores que en el entorno conservado para el inicio de voz.
Los marcadores controlados por el modelo, las barreras de aborto, los prompts de rescate y las segundas solicitudes añadieron complejidad y siguieron produciendo fallos de cumplimiento, hechos y proporcionalidad.
Por qué la rama no supera todas las comprobaciones
La mediana mejoró. La conversación sigue fallando de formas importantes.
En la última prueba física, una falsa interrupción acústica canceló una respuesta válida del asistente. Cohere clasificó después la interrupción candidata como ruido de una sola palabra, por lo que el usuario no recibió ni la respuesta original ni un turno de sustitución válido.
La sesión también terminó con tres unidades generadas temporales aún presentes. Solo existían ocho muestras de Qwen y contexto, por debajo del criterio de historial sostenido de diez muestras, y ninguna interrupción limpia admitida demostró físicamente la nueva anotación del historial desechable.
Reversión y estado del desarrollo
Se conserva la referencia medida; el trabajo posterior del repositorio no se ha vuelto a verificar.
La referencia de la prueba física se mantiene deliberadamente separada de los commits más recientes del repositorio. El código nuevo y la estructura de experimentación no constituyen evidencia más sólida hasta que vuelva a ejecutarse toda la ruta física.
Los once commits de CP09-I posteriores a la referencia implementan una protección de fin de secuencia del proveedor para inicios breves, conservación de puntos de control hasta la interrupción, limpieza de cancelación con metadatos de reanudación, gestión acotada con degradación controlada de comportamientos largos de Cohere y PCM, y segmentación por límites de frase y continuación con pruebas de regresión. Son cambios implementados, no una nueva verificación física.
- Referencia de la prueba física
64df168f4a8711a07def4f598e91f30f35f9e46b
Fuente de la latencia medida de CP09-I y del registro de fallos de esta página.- Último commit de la rama CP09-I
b4d7212f827006578c628c380f10435757777f31
Documentación de congelación numérica en la referencia remota de rama revisada; no sustituye a la referencia de evidencia física.- Último commit del repositorio revisado
ms08/cp09j-qwen-decode-frontier478699e8b9c2c9ecdbb45d8d9d8b15ce2957b812define el siguiente experimento sobre los límites de decodificación. No se afirma ningún resultado de CP09-J.- Límite de la evidencia
- CP09-I se ha probado en Thor con fallos conocidos. Las reparaciones posteriores y CP09-J son trabajo implementado o documentado en el repositorio; no existe una verificación física posterior para ellos.
Límites actuales de la evidencia
Dónde se encuentra Evopien el 2 de septiembre.
Existe funcionamiento desde el micrófono hasta la reproducción física en el punto de control congelado y el sistema exactos descritos anteriormente.
La mediana exacta fue de 1,3705 s desde el final del habla hasta el primer PCM; el P95 fue de 1,7971 s. No es una cifra garantizada ni de audibilidad acústica.
La arquitectura de sesión y caché de Core de 100.000 turnos superó su corpus declarado solo de texto en Thor; la verificación física sostenida sigue sin alcanzar el número de muestras.
Inglés y español de España cuentan con evidencia acotada de subrutas, pero el corpus físico emparejado de salida y los criterios de ciclo de vida no se han superado.
Las reparaciones posteriores de CP09-I y la estructura de experimentación de límites de decodificación CP09-J están presentes en el historial revisado del repositorio; no se afirma una verificación física posterior.
La captura independiente de C920 funciona. El vídeo actual de Qwen3.8, el estado acotado de la escena, la coexistencia y la gestión de actualidad siguen siendo trabajo de MS-09.
Foundation v1.2 sigue siendo la referencia rectora; los criterios de privacidad, usuarios reales, recuperación, seguridad, aislamiento independiente y despliegue siguen pendientes.

