5–9 de septiembre / J-014
La primera base integrada ya merece conservarse.
Desde el punto de control del 5 de septiembre, 424 commits de ingeniería han reunido conversación, visión e investigación en internet en una única plataforma de demostración funcional.
He congelado esa base y la he incorporado a main. Es el punto de partida para la memoria gobernada y unos límites de permisos más sólidos. Se ha logrado una integración útil; la aceptación formal y los defectos restantes siguen siendo visibles.

Qué cambió
Cuatro partes de una misma base funcional.
5–6 de septiembre / Voz y visión
De adjuntar vídeo siempre a aportar la evidencia adecuada para cada pregunta.
J-013 terminó con una versión candidata que adjuntaba una selección visual de los 15 segundos anteriores a cada turno normal de Qwen. El trabajo posterior de CP08–CP11 separó la evidencia en directo de la del historial reciente, aumentó la calidad de imagen en directo, amplió los controles en inglés y español de España y reforzó la limpieza en el proceso que realmente controlaba los recursos. Los turnos normales de Qwen seguían recibiendo vídeo ambiental en directo en CP11. CP15 introdujo después la separación compartida entre texto, directo e historial, excluyendo datos visuales nuevos de las solicitudes que usan texto por defecto.
Esa distinción importa. Una pregunta sobre la sala en este momento necesita evidencia nueva. Una pregunta sobre una acción de hace diez segundos necesita una secuencia con marcas de tiempo. La conversación normal no debería asumir el coste de datos visuales innecesarios. Tampoco debe tratar silenciosamente una descripción anterior del modelo como una nueva observación de la cámara.
CP12 se centró en la ruta de latencia: la configuración cache16 existente, el control de la reproducción, la cancelación, la repetición y la medición. CP13 añadió recuperación semántica sobre la conversación abierta, manteniendo acotado el contexto de trabajo de Qwen. Las versiones candidatas con mayor precarga de contexto y decodificación especulativa no cumplieron sus condiciones para avanzar; la referencia cache16 conservada no se sustituyó simplemente porque mejorase una cifra aislada de rendimiento. La conservación de la fuente de repetición y la finalización explícita de la cancelación abordaron fallos del ciclo de vida conversacional. La referencia local se aceptó y congeló en f42bb577 antes de integrar internet.
La prueba de recuperación de CP13 utilizó el codificador multilingüe E5-small real sobre 2.018 fragmentos sintéticos y 51 épocas simuladas: se superaron diez de diez comprobaciones de recuperación, con un máximo de 63,253 ms. El recuerdo seleccionado se limita a doce intercambios y 2.000 caracteres dentro del presupuesto de contexto de 9.000 caracteres. Eso prueba la recuperación, no la exactitud de las respuestas.
La ejecución física local conservada completó veinte turnos y canceló uno, con seis renovaciones del contexto y tres cambios de idioma. El P50/P95 de visión en directo, calculado por rango más próximo, fue de 3,182/3,946 segundos en inglés (nueve turnos) y de 3,380/3,969 segundos en español de España (siete turnos), desde el final del habla hasta el primer PCM. Los cuatro turnos de historial formaron muestras independientes más pequeñas. Siguieron registrados fallos de recuerdo de correcciones y razonamiento sin etiquetar que llegaba a la voz. Estos resultados locales utilizan una prueba distinta de la demo posterior en la nube.
Este recuerdo de sesión es un índice derivado de la conversación pronunciada, bajo el control de Core. No es memoria duradera gobernada, una autobiografía independiente ni permiso para escribir recuerdos permanentes. El habla interrumpida o meramente programada no debe convertirse en algo que Evopien dé por oído por la persona.
CP14 y CP15 introdujeron después una comparación opcional independiente en la nube. La referencia conservada de CP15 detail12 es 1bdc32ca. Groq sustituye el diálogo y el razonamiento visual seleccionados, mientras se mantienen los responsables locales de voz, cámara, percepción y Core. Estos experimentos no establecen una aceleración controlada de nube frente a local: las ejecuciones y los prompts son diferentes.
6–9 de septiembre / Internet
Un resultado de búsqueda es solo el comienzo de una respuesta.
El primer trabajo de internet local añadió recuperación tipada, lectores específicos de cada proveedor y pruebas más amplias. La parte difícil era la cadena completa: admitir una pregunta pública legítima, encontrar fuentes utilizables, abrir las páginas correctas, comprobar las evidencias y producir una respuesta hablada útil dentro de un plazo práctico.
La primera evaluación de 100 casos, limitada a recuperación, devolvió alguna evidencia para 65 preguntas y ninguna para 35. Eso midió disponibilidad, no la calidad de las respuestas finales. Las rutas estructuradas y sin clave podían devolver información útil, mientras la búsqueda genérica, la lectura de páginas y la disponibilidad de proveedores y claves seguían siendo irregulares. Mejoraron la ruta de Wikipedia y las pruebas de recuperación, pero las preguntas naturales de seguimiento seguían fallando, lo que motivó un ciclo de investigación más semántico controlado por Qwen.
Los experimentos revelaron resultados vacíos, evidencias únicamente obsoletas, proveedores no disponibles, tareas públicas rechazadas por Core, fallos de fundamentación y tiempos de espera agotados. Se compararon rutas de investigación directas y eficientes con un banco de 100 preguntas. Las decisiones estructuradas compactas, los identificadores de candidatos con ámbito definido y los diagnósticos por fases facilitaron localizar los fallos. Disponer de 100 preguntas no significa haber superado las 100.
Una referencia aislada de Open WebUI proporcionó después otra forma de probar la misma experiencia de usuario. Avanzó mediante flujos acotados de búsqueda y lectura, enrutamiento conversacional, decisiones estructuradas y la herramienta DuckDuckGo de James Jones. El acceso en flujo continuo desde un terminal Linux hizo visibles la respuesta y su progreso fuera del navegador, listos para la ruta ASR/TTS existente.
El 9 de septiembre, el proceso de recuperación de James se integró directamente con el entorno de conversación local. Core admite una pregunta pública, un proceso aislado devuelve evidencias y Qwen local responde a través de la cola de voz establecida. El perfil integrado final no requiere un servidor Open WebUI ni una segunda fase de generación de respuesta de Open WebUI.
Qwen, voz y Core pueden ejecutarse en Thor. La investigación pública con James/DDG sigue contactando con sitios web y servicios de búsqueda externos. El perfil opcional en la nube envía además solicitudes seleccionadas a Groq o Exa.
Los experimentos fallidos permanecen en el registro.
Un atajo basado solo en titulares devolvió noticias fuera de tema o vacías y se revirtió para conservar la evidencia de las páginas. Una versión candidata posterior de recuperación redujo las comprobaciones de ejecución de 91 a 68 y los casos con evidencia actual de 23/30 a 11/30; se restauró el árbol anterior. Estos recuentos describen ejecución y disponibilidad de evidencias, no porcentajes de exactitud factual.
Otro filtro obligatorio de fechas de noticias descartó dos respuestas reales de ocho fuentes, sin dejar ninguna fecha de fuente coincidente. Ese cambio de noticias se revirtió, mientras se conservaron las reparaciones de voz para horas, divisas y dominios. La relevancia de las noticias actuales, sus fechas de publicación y la actualidad de las fuentes siguen, por tanto, pendientes.
La primera ejecución local integrada también reveló un bloqueo de WAIT/CONTINUE. Se repararon el control de la repetición y la reanudación supervisada de la voz. También se trabajó en la admisión de consultas públicas, las respuestas actualizadas del reloj del dispositivo, las afirmaciones de búsqueda sin respaldo y el formato hablado. Las regresiones no se promovieron simplemente por ser más recientes.
Dos rutas distintas de Exa
Recuperar evidencias y generar la respuesta de investigación son decisiones separadas.
La ruta opcional de búsqueda Exa MCP devolvía inicialmente evidencias para que Qwen local las sintetizase. Una prueba meteorológica tardó 15,258 segundos desde el final del habla hasta el primer PCM: 4,262 segundos de recuperación y 9,180 segundos desde la solicitud instrumentada al modelo local hasta su primer token. Esto reveló el cuello de botella de esa prueba; no es un tiempo universal del modelo local.
La siguiente ruta utilizó Exa /answer para generar directamente la respuesta pública con citas. Dos pruebas independientes de texto se completaron en 1,729 y 1,689 segundos. Eran mediciones de texto, no tiempos de voz. La integración transmitió después la respuesta con citas mediante la normalización, la cola, el registro y la cancelación existentes de Core, sin otra reescritura de Qwen local.
Exa recibe la consulta pública admitida y controles acotados de fecha e idioma. El límite de solicitud implementado excluye medios de cámara, audio, recuerdo privado y estado de identidad. La voz espera a disponer de citas y de un segmento de texto utilizable; el reintento automático con coste está desactivado. Las pruebas ejercitan este límite, pero la demo no demuestra privacidad ni seguridad de red completas.
La arquitectura congelada
Dos perfiles. Un único ciclo de conversación local.
| Función | Local + James | Nube |
|---|---|---|
| Diálogo | Qwen3.8 local mediante el entorno existente SGLang/cache16 | Groq; el registro conservado identifica qwen/qwen3.8-27b |
| Visión seleccionada | Vídeo nativo seleccionado en directo o del historial reciente | Imágenes nuevas u hojas de contacto detail12 con marcas de tiempo enviadas a Groq |
| Investigación pública | Recuperación aislada con James/DDG; Qwen local redacta la respuesta | Exa /answer aislado transmite una respuesta con citas sin reescritura local |
| Voz y turnos | Cohere Transcribe local, política de Smart Turn/Core y voz Scylla en CPU | Los mismos responsables locales de voz y turnos |
| Cámara y percepción | Un único responsable de C920; detección y seguimiento locales con DeepStream/TensorRT | La misma captura y percepción locales |
| Identidad y sesión | Core, permisos, registro de lo pronunciado y recuerdo temporal permanecen en Thor | El estado canónico permanece en local; puede enviarse a Groq contexto seleccionado y acotado |
La identidad canónica, los permisos y el registro con autoridad permanecen en Thor. El perfil en la nube envía a Groq contexto conversacional y evidencias visuales seleccionados y acotados; no es un modo de privacidad totalmente local. Exa tiene el límite más estrecho de consulta pública descrito anteriormente.
Estos nombres de proveedores describen la configuración revisada y las etiquetas del registro. El reconocedor de voz real es Cohere Transcribe residente en local, que trabaja por enunciados; la síntesis utiliza Scylla INT8 local en CPU, la voz ink y salida a 24 kHz. Los antiguos indicadores de estado de Riva, Parakeet y Magpie no identifican el backend activo.
El reSpeaker XVF3800 permanece en la ruta de reproducción para conservar su referencia de cancelación de eco por hardware. La C920 se captura una sola vez con la configuración de 1280×720/30 FPS. La ejecución final utiliza detección RT-DETR R50vd COCO/O365 FP16 con la ruta de seguimiento local; las referencias anteriores a RF-DETR describen otra configuración.
El detalle en directo y el historial reciente tienen presupuestos distintos.
El historial temporal de cámara conserva ahora 15 segundos a ocho muestras por segundo, hasta 121 JPEG comprimidos en RAM. La visión local en directo selecciona ocho fotogramas de aproximadamente el último segundo a 960×540; el historial local selecciona dieciséis fotogramas a 640×360.
Cloud detail12 selecciona una imagen original nueva a 720p para preguntas estáticas, tres para movimiento en directo o hasta doce muestras históricas con marcas de tiempo en tres hojas de contacto de 2×2. Las hojas históricas se preparan fuera de la ruta de solicitud. Las solicitudes de texto por defecto no deben incluir nuevos datos visuales. El procesamiento temporal es independiente del permiso para conservar recuerdos visuales permanentes.
9 de septiembre / Una interfaz de demostración
La consola muestra el entorno que realmente se ejecuta.
Una consola local y un lanzador de terminal compartidos ofrecen ahora los perfiles local y en la nube, entrada escrita o por voz, selección de inglés o español de España, inicio y parada, detención del habla y silenciamiento del micrófono por software. La consola muestra las etapas de ejecución, la latencia medida por software, la vista previa compartida de la cámara y las evidencias visuales reales seleccionadas para una solicitud al modelo.
El avatar en pantalla reacciona a la amplitud de reproducción y a las señales actuales de presencia de personas. Es una interfaz ilustrativa, no una cabeza física, sincronización labial a nivel de fonemas, reconocimiento ni una prueba de comprensión emocional.
Tras detener la sesión se pueden exportar diagnósticos acotados de texto/JSON. Las claves de proveedores no se entregan al navegador; las exportaciones excluyen credenciales y audio o vídeo sin procesar, pero el texto de la conversación sigue siendo sensible. Ocultar la vista previa de cámara no detiene la captura, y silenciar por software no equivale a una desconexión física de privacidad. La sesión permanece en RAM hasta el siguiente inicio o la salida de la consola.
Evidencias físicas conservadas / 9 de septiembre
Qué probó la demostración final en la nube.
La sesión registrada duró unos 8 minutos y 39 segundos, incluidos arranque y cierre. Comenzó en inglés y terminó en español de España. Dieciocho solicitudes de Groq devolvieron HTTP 200; ocho rutas de respuestas de Exa devolvieron fuentes. Se registraron quince interrupciones confirmadas y una pausa/reanudación WAIT/CONTINUE aceptada con cuatro unidades de repetición.
La percepción local procesó 14.172 fotogramas a una velocidad informada de 28,996 FPS, sin identificadores de seguimiento, cajas ni metadatos inválidos. Setenta solicitudes a Cohere no informaron de fallos. La sesión terminó normalmente con código de salida 0, sin parada forzada, con la barrera de precálculo superada y ningún medio retenido.
Son observaciones de ejecución acotadas verificadas en Thor. Una solicitud completada no demuestra que su respuesta fuera correcta o se oyera íntegramente. La exportación final no repite la verificación de la última consola local Qwen + James; ese perfil está implementado y hereda evidencias locales anteriores.
| Ruta | Turnos | P50 | Rango observado |
|---|---|---|---|
| Diálogo en la nube | 5 | 1,4203 s | 1,1916–1,6060 s |
| Visión en directo en la nube | 4 | 1,7264 s | 1,7090–2,0094 s |
| Historial reciente en la nube | 2 | 2,0818 s | 2,0818–3,1339 s |
| Respuestas de investigación de Exa | 8 | 3,0035 s | 2,7965–4,8142 s |
La medición comienza al detectar el final del habla y termina cuando está disponible el primer PCM en software, antes de escribir en el dispositivo. Las muestras incluyen entradas de transcripción completadas con un objeto de latencia; P50 utiliza el rango más próximo, la observación central inferior cuando hay un número par de muestras. Estos pequeños grupos descriptivos no son distribuciones de éxito aceptadas, mediciones acústicas ni una comparación local/nube con condiciones emparejadas.
Los 27 objetos de latencia de la transcripción mantuvieron qualified=false. Fallaron los filtros heredados de tiempo sostenido hasta el primer token y de primer PCM de ≤1,3 segundos P95. Esos filtros mezclan rutas en este informe y requieren una interpretación cuidadosa, pero no se cambió ningún umbral para convertir la congelación en una aprobación. Que el generador del informe termine correctamente no significa que el sistema supere sus criterios de latencia.
Qué sigue fallando
La congelación conserva tanto los errores como la base útil.
- Una solicitud en español sobre historial reciente se dirigió a texto sin imágenes y repitió una escena anterior. Otra pregunta sobre la cámara tuvo que reformularse para llegar a la visión en directo.
- Se rechazaron preguntas legítimas de enciclopedia y divisas como consultas privadas o públicas sin resolver. La reformulación permitió llegar a la investigación.
- Las citas devueltas siguen necesitando revisión factual, de publicación y de actualidad. Tener fuentes no demuestra que todas las afirmaciones estén respaldadas.
- Algunos estados de transcripción quedaron pendientes o en curso en la exportación finalizada; las etiquetas de reproducción y los indicadores de finalización no demuestran una entrega audible completa.
- La lectura de versiones técnicas todavía puede unir dígitos incorrectamente. Las respuestas interrumpidas de Exa seguidas de repetición y continuación con Groq necesitan una procedencia más clara para que un cambio de proveedor no herede silenciosamente una afirmación de fuente.
- La última consola local, la cobertura de enrutamiento bilingüe, la fiabilidad de la información visual, la calidad de las interrupciones y las colas de latencia aún necesitan una verificación controlada.
MS-07, MS-08 y MS-09 siguen pendientes. Esta es una congelación de una demo funcional aceptada por el fundador, no Alpha, uso doméstico validado, certificación ni permiso para movimiento motorizado.
La siguiente fase de desarrollo
Decidir qué merece convertirse en memoria.
La integración ya es suficientemente útil para mantenerla estable mientras se construye la siguiente capa. El trabajo comienza con diseño y pruebas sintéticas: conservación selectiva, procedencia, ámbitos personal y doméstico, permiso explícito, consulta, corrección, eliminación y auditoría.
Core controla las decisiones de memoria. Qwen, Groq, voz, visión y la consola son interfaces y proveedores reemplazables. Una respuesta generada, una descripción visual obsoleta, una frase interrumpida o un resumen externo no pueden convertirse en un hecho permanente autorizado simplemente por haber aparecido en una conversación.
La identidad Thor ya se creó una vez en MS-06 con linaje de ingeniería declarado. Esta fase no la vuelve a crear ni importa los recuerdos de su predecesor. Foundation v1.2 aprobada sigue siendo la referencia rectora; los borradores posteriores de Foundation y Alpha no la sustituyen de forma silenciosa.
El hardware de la cabeza continúa mediante contratos de movimiento independientes, control local y evidencias de seguridad independientes. El trabajo de memoria, los participantes reales y el cuerpo con movimiento motorizado mantienen cada uno sus criterios aplicables. La tarea inmediata es conservar la demo útil, corregir sus regresiones conocidas y fundamentar las próximas decisiones de memoria.
Límites de las fuentes y referencias de ingeniería
J-014 compara la versión v1.7.0 del sitio web en 694390dad9136142f107b989bc0a75b1dfd88f32 con el trabajo de ingeniería posterior al cierre de J-013 en 443db7f53e623983842917568ab25b0dce44caea: 424 commits alcanzables hasta 99571bfb8efe05f12b3ba762bc988290f16df321.
La rama main de ingeniería y ms09/20260909-demo-console-freeze apuntan al mismo punto de control documental. El ejecutable probado físicamente es f3bf57db5ab2a8623bf89c09c1433e43c6493106; la congelación solo cambió documentación. Un ejecutable sin cambios no es una instantánea completa del modelo, del sistema operativo ni del contenedor.
Las fuentes revisadas incluyen los registros vigentes del programa; los registros operativos de CP08–CP15; las congelaciones local CP13 y CP15 detail12; el registro de logros de ingeniería del 6 de septiembre; los registros de implementación y reversión de MS-07; ADR-0057–0066; el manual operativo de la demo; y docs/operations/EVOPIEN_THOR_CHECKPOINT_2026-09-09.md, registro EVD-MS09-20260909-DEMO-FREEZE-01. La demo final se registró el 9 de septiembre entre las 22:43 y las 22:52, Europe/Madrid. Las cifras públicas aquí son agregados saneados; no se publica la exportación de la conversación sin procesar.

