CommandAGI
AprenderPreciosDocumentación
Iniciar sesión
CommandAGI

Visión, inteligencia y control — inteligencia que puedes ver, especificar y confiar, actuando en entornos reales.

Plataforma

  • Producto
  • Inteligencia
  • Percepción
  • Previsión
  • Robótica
  • Coordinación
  • Impresión 3D
  • Servicios
  • Tienda
  • Sitios
  • Precios

Explorar

  • Mundos
  • Hilos
  • Aprende CommandAGI
  • Documentación
  • Demostraciones
  • Consigue la app
  • Inicia un negocio
  • La Economía del Mando
  • Ecosistema
  • El Fondo de Oportunidad
  • Gana desde tu teléfono
  • Prueba de reservas
  • Estado

Empresa

  • Integridad
  • Confianza y verificabilidad
  • Acerca de
  • Visión
  • Investigación
  • Blog
  • Marca
  • Contacto

Legal

  • Privacidad
  • Términos
  • Suscripción SMS
  • Cookies
  • Todo lo legal
© 2026 CommandAGI INC. Todos los derechos reservados. · Alineado con GDPR y CCPA · SOC 2 en curso
TérminosPrivacidadCookiesEstado

Canvas Engineering

Macroestructura causal declarada para dinámicas latentes de difusión inversa

Por Jacob Valdez

Primera página del artículo Canvas Engineering — título, autor, Figura 1 y resumen.
Leer

¿Y si pudieras proyectar la estructura causal de cualquier dominio sobre la propia geometría neuronal? Los modelos del mundo actuales quitan ruido a una bolsa plana de tokens: todo puede atender a todo, y la estructura que el modelo acabe usando la descubre por su cuenta, enterrada en pesos que no puedes leer. Canvas engineering es la apuesta contraria: es ingeniería de prompts para la dinámica del espacio latente en difusión inversa. Tú declaras la estructura de antemano y un compilador la hace exacta.

Distribuyes regiones con nombre sobre el canvas de difusión y declaras qué regiones pueden siquiera influir en cuáles otras, con qué frecuencia se actualiza cada una y qué papel juega cada una en la pérdida. Un compilador baja todo eso a máscaras de atención, pesos de pérdida y correspondencias de fotogramas sobre un transformer de difusión preentrenado de serie. El resultado: en lugar de una difusión inversa uniforme sobre una bolsa plana de tokens, la conectividad que declaraste hace que solo bloques concretos puedan afectarse entre sí. Esa restricción dura induce un grafo causal explícito y legible por humanos dentro de la dinámica de difusión inversa.

A la izquierda, una declaración de CanvasLayout y CanvasTopology; a la derecha, el compilador cableándola en un canvas ya distribuido con flechas de flujo de información.
Tú lo declaras; el compilador lo cablea. Las regiones se vuelven desplazamientos tipo struct sobre una rejilla espaciotemporal, y cada Connection declarada se convierte en una arista de atención autorizada: una flecha de flujo de información que puedes señalar.

El reparto: tú fijas el cableado, los gradientes aprenden los pesos

La división del trabajo es precisa. Tú fijas si una arista existe, su dirección y su extensión temporal. Los gradientes — guiados por los datos o por pérdidas intrínsecas — determinan qué fluye por cada arista y todo lo que ocurre dentro de una región. Lo simbólico es lo macro; lo neuronal se queda en lo micro.

Y no hay interfaz entre las dos capas, porque la capa simbólica literalmente es la máscara de atención. Si no hay camino entre dos regiones, su independencia es exacta por construcción: una prohibición dura, no una penalización de regularización que el modelo pueda aprender a violar. Las aristas ausentes producen independencia marginal exacta; puedes demostrar que una región no puede influir en otra con solo leer el grafo.

Izquierda: una matriz de bloques 3x3 de qué regiones pueden atender a cuáles, donde acción a visual está activa pero visual a acción no. Derecha: la máscara de atención real ya compilada sobre 186 posiciones asignadas.
La topología es la máscara. Izquierda: la estructura de bloques — las celdas oscuras son aristas autorizadas, y es asimétrica (acción → visual activa, visual → acción inactiva). Derecha: la máscara realmente compilada sobre las posiciones latentes asignadas, donde la región visual empequeñece a acción y recompensa.

Vistas así, arquitecturas conocidas caen como casos particulares. Una política de difusión markoviana estándar no es más que un canvas de dos nodos: (observación) → acción, y (observación + acción) → siguiente observación. La coordinación multiagente tiene más piezas, pero no es menos limpia: cada agente se autoatiende sobre sus propias observaciones y acciones, y los agentes se coordinan solo a través de las aristas cruzadas que declares. La topología es el protocolo de coordinación, escrito como datos.

Izquierda: cuatro robots en torno a una tarea compartida en el mundo real, con conos de visión y flechas de movimiento. Derecha: la misma estructura causal compilada sobre el canvas como regiones de observación/acción por agente que se coordinan a través de una región de despacho compartida.
Multiagente, por los dos lados: la estructura causal que existe en el mundo (izquierda) y el canvas que el compilador construye a partir de ella (derecha) son el mismo objeto. La política de cada robot es observación → acción; solo se encuentran en la región compartida declarada.

Decláralo en código: los esquemas compilan a canvas

Repartir territorio latente a mano no escala. Por eso hay una capa superior: la biblioteca de canvas engineering es un compilador de declaraciones de esquema tipadas. Escribes la estructura causal como un objeto Python normal — dataclasses tipadas y anidadas con campos, pesos de pérdida y relojes de actualización — y compile_schema() la aplana en regiones y máscaras de atención por ti. Las relaciones complejas quedan declaradas de forma explícita y transparente, en código que puedes revisar.

Para forzarlo, describimos la estructura a gran escala de una unidad de cuidados intensivos: seis pacientes con fisiología a nivel de órganos, cuatro enfermeras con dinámica de fatiga, presión aseguradora y de plantilla, y unidades familiares. Una sola llamada a compile_schema() asignó y empaquetó 199 regiones y 1077 conexiones sobre el canvas: heart_rate actualizándose cada fotograma, creatinine cada 24, cada una con su propio reloj declarado.

Tres paneles: el esquema pydantic composicional de una unidad de cuidados intensivos; el grafo causal que denota, con una vía de sepsis declarada; y el canvas compilado de 199 regiones y 1077 conexiones, con regiones concretas señaladas como patients[2] y nurses[1].
Una declaración, tres vistas fieles: el esquema que escribes (izquierda), el grafo causal que denota con la vía de sepsis declarada renal → cardio → neuro (centro) y el canvas autoempaquetado de 199 regiones y 1077 conexiones (derecha). Un modelo plano aprendería correlación; un modelo de canvas está obligado a enrutar por la vía causal declarada.

Y algo decisivo: cada región y cada arista es una decisión que puedes releer. Abajo hay tres vistas de una misma conectividad declarada de la unidad, cada una resaltando un enlace distinto — la acción de una enfermera que cambia a un paciente entre fotogramas, un estado que alimenta el riesgo, un estado que persiste en el tiempo — y cada una anotada con la razón causal por la que existe. No estás condenado a sondear e ingeniería inversa de lo que un modelo haya aprendido por su cuenta: el grafo lo escribiste tú.

Un canvas de tres fotogramas que muestra una arista declarada de acción de enfermera a estado del paciente a lo largo del tiempo, anotada con la razón: las acciones de una enfermera cambian materialmente la fisiología del paciente en el paso siguiente.
Una arista resaltada de la misma unidad: enfermera → paciente entre fotogramas, habilitada porque la acción de una enfermera cambia materialmente la fisiología del paciente en el paso siguiente. La arista codifica un efecto causal conocido, y es legible porque la declaraste.

El tensor latente es direccionable

Esa legibilidad apunta a una propiedad más profunda. El esquema del canvas es paralelo a la semántica de un struct en C: los límites de región son desplazamientos de struct, la topología es una convención de llamada y un esquema serializado es una ABI. El tensor latente pasa a ser direccionable: puedes nombrar exactamente qué posiciones son nurses[1] y leerlas. Es mapeo de memoria para compiladores, pero sobre el canvas latente de difusión.

Dos modelos que comparten un esquema pueden, por tanto, intercambiar estado latente directamente: sin tokenización, sin recodificación. Eso es un bostezo cuando la difusión es simplemente torch sobre una GPU, pero se pone serio en cuanto tienes que reaprovechar silicio optimizado para generar vídeos de gatos y ponerlo a hacer trabajo real: una ABI compartida es cómo mueves estado latente entre chips sin un viaje de ida y vuelta de decodificación y recodificación por medio.

La única prueba de existencia: la corteza

Este marco nos acerca a la única prueba de concepto que tenemos de inteligencia general: el cerebro humano. Muchos neurocientíficos llevan tiempo sosteniendo que la conectividad funcional de la corteza refleja la estructura causal de su entorno. Y el reparto resulta familiar: la conectividad funcional a gran escala (el cableado macro) viene en buena medida especificada por el conectoma y es efectivamente fija, mientras que los micropesos se ajustan por plasticidad sináptica a lo largo de una vida. Topología fija, pesos aprendidos. Ese es exactamente el reparto que hace canvas engineering.

Mira de cerca y una matriz de conectividad cortical y una máscara de atención de canvas son el mismo objeto: origen × destino, diagonal por bloques dentro de una red, aristas dispersas y específicas entre redes, y cada celda cargando su propio tipo de operador. El conectoma es una topología de canvas.

Una matriz de conectividad de canvas cortical sobre 23 regiones de Destrieux, origen por destino, diagonal por bloques dentro de cada red (visual, auditiva, del lenguaje, frontal, por defecto, subcortical) con aristas dispersas entre redes, cada celda etiquetada con un tipo de operador.
Una matriz de conectividad cortical representada como topología de canvas: 23 regiones de Destrieux, origen × destino, diagonal por bloques dentro de cada red funcional y con aristas dispersas y específicas entre redes. El color es el peso de la conexión; el texto de cada celda es el tipo de operador. Es el mismo tipo de objeto que la máscara de atención de arriba.

Para poner a prueba la afirmación, cableamos 23 regiones de Destrieux sobre 42 vías corticales conocidas — sobre todo dentro del bucle de la red por defecto, la vía visual ventral, A1 → Wernicke → Broca y prefrontal → premotor → motor — y lo entrenamos con predicciones corticales reales del codificador cerebral TRIBE v2 de Meta. El canvas de topología declarada satura en R² = 0,825 en dinámica de un solo paso temporal, igualando a un modelo totalmente denso con el 19,6 % de las conexiones y un entrenamiento unas 5× más rápido. Aquí la topología es un prior de convergencia, no una ventaja de capacidad.

Dos gráficos de barras. Izquierda: predicción de dinámica cortical real de TRIBE v2, canvas cortical con R2=0,825 y un 19,6 % del cableado, igualando al modelo denso con R2=0,826. Derecha: decodificación BCI desde EEG virtual, decodificador de canvas 69 % frente a SVM 59 % y azar 25 %.
El canvas cortical iguala la precisión de un modelo totalmente denso (R² = 0,825 frente a 0,826) con 1/5 del cableado y 5× más rápido, y una lectura de decodificación cerebral de 4 clases desde el modelo alcanza el 69 % (frente al 59 % de una SVM lineal y un 25 % de azar). La topología es un prior de convergencia, no más capacidad.

Merece la pena detenerse aquí si esto no acaba de encajar: el aprendizaje automático vive en silos, y hay mucho tiempo que ahorrar aprendiendo de la neurociencia. (La biología nunca es tan simple como cualquier modelo suyo; esta es una conexión que vale la pena trazar, no una afirmación de que la corteza sea un transformer de difusión.) Queda mucho por desarrollar, y lo haremos.

Qué dicen realmente las mediciones

El registro empírico es deliberadamente honesto. A lo largo de 26 experimentos y 236 entrenamientos sobre CogVideoX-2B con BridgeData V2, el titular es un estudio de atención en bucle: iterar bloques congelados del transformer de difusión con embeddings de iteración aprendidos. Una configuración congelada de 3 bucles con solo 350 K parámetros entrenables superó a todas las condiciones sin congelar con 11,7 M — una eficiencia de parámetros de 1,73× con p < 0,001, y representaciones de bucle que convergen a puntos fijos.

Gráfico de barras de la pérdida de acción (menos es mejor): la configuración congelada de 3 bucles con 350 K parámetros en 0,073 supera a la medio congelada de 3,7 M en 0,107 y a la no congelada de 11,7 M en 0,088.
Atención en bucle: un backbone congelado con 3 bucles y 350 K parámetros entrenables alcanza la menor pérdida de acción (0,073) y supera a un modelo sin congelar de 11,7 M de parámetros — 33× menos parámetros entrenables, y el mejor resultado.

Tres calibraciones mantienen la historia honesta:

  1. A esta escala, el beneficio del bucle es la regularización por compartir pesos, no un razonamiento iterativo detectable. Lo decimos.
  2. La estructura tiene que estar declarada: la mera coexistencia plana de modalidades degradó la predicción conjunta un 19 % (p < 0,0001). Meter tokens en el mismo tensor no es estructura; la topología sí.
  3. El diseño del canvas perdona: la pérdida fue casi insensible a cómo se repartieran exactamente los tokens (α = 0,011). Lo que hay que acertar es el grafo, no el presupuesto de píxeles.

Dos notas de alcance que mantenemos: los diseños de la UCI y del control aéreo son demostraciones arquitectónicas, no sistemas clínicos u operativos validados; y el modelo cortical predice las salidas de un codificador cerebral, no actividad neuronal medida directamente.

Qué queda abierto

La pieza clave es la estabilidad de la representación: el intercambio latente mediado por esquema, la calibración de la distancia de transferencia y las modalidades enchufables dan por hecho que una misma estructura declarada induce una geometría alineada de forma predecible entre semillas y backbones. Plausible, y sin demostrar. Más allá: una ablación decisiva de topología declarada frente a plana sobre el binding; si la estructura declarada sigue rindiendo a medida que datos y parámetros escalan más allá de 2 B; y la topología aprendida — proponer y podar aristas bajo un prior de dispersión, con el esquema declarado como prior y no como última palabra.

Pruébalo

Canvas engineering disuelve la frontera neuronal/simbólica convirtiendo el artefacto simbólico en un esquema — un sistema de tipos para el cómputo latente — cuya ejecución es atención enmascarada dentro de un transformer de difusión de serie. El artículo trae la derivación completa, los diseños trabajados (manipulación, flotas, control aéreo, la UCI, la corteza) y el archivo experimental íntegro.

La biblioteca

Un compilador Apache-2.0 que baja un esquema tipado de regiones, conectividad y relojes de actualización a máscaras de atención sobre un transformer de difusión preentrenado de serie. Incluye ejemplos ejecutables de cartpole, flotas de vehículos, el modelo hospitalario y conectividad cerebral.

pip install canvas-engineering
from canvas_engineering import compile_schema, CanvasModel

# Declare the causal macrostructure; the compiler lays it out.
canvas = compile_schema(MySchema)          # regions + attention mask
model = CanvasModel.from_pretrained("cogvideox-2b", canvas=canvas)

model.fit(dataset)                          # gradients learn the weights
state = model.rollout(obs)                  # you fixed the wiring
Leer el artículo (PDF)CódigoDocumentación y ejemplos ejecutables

Cómo citar: Valdez, J. Canvas Engineering: Declared Causal Macrostructure for Reverse-Diffusion Latent Dynamics. CommandAGI Technical Report, 8 de julio de 2026.

Más investigación