Divide un objetivo abierto en acciones concretas que puede ejecutar en el entorno.
Opera la máquina directamente: mouse, teclado, terminal, navegador, apps, actuadores.
Observa qué cambió, se recupera de callejones sin salida y sigue hasta terminar.
La mayoría de los modelos son una caja negra: entra un objetivo, sale una acción y los pasos intermedios son un vector que no puedes inspeccionar. La serie 000 mantiene su razonamiento como estructura, así puedes ver por qué hizo lo que hizo, especificar qué debe hacer la próxima vez y detectar un error antes de que se convierta en una acción.
Un modelo tipado de la pantalla —ventanas, botones, campos— extraído de píxeles crudos. Sin DOM.
Cada acción se compara con el cambio que realmente provocó. Nada se disimula.
Lo que hace un control se aprende con la experiencia; el reconocimiento se calibra en línea con tus apps.
Di lo que debería haber hecho y la corrección se mantiene: la siguiente ejecución sigue tu especificación, no otra tirada de dados.
Los grandes modelos de lenguaje aportan razonamiento fluido y amplio conocimiento del mundo. Nosotros aportamos las tres cosas que les faltan: percepción anclada que lee estructura directo de los píxeles, un grafo de conocimiento profesional contra el cual razonar, y computadoras, robots y mundos 3D reales donde actuar. Apunta un modelo frontera a nuestra capa y deja de adivinar sobre la pantalla y el mundo: ve, recuerda y hace.
Grafos de escena tipados a partir de píxeles crudos: lo que hay en la pantalla o en la sala, como estructura sobre la que un modelo puede actuar, con cada nodo trazable al fragmento del que salió.
Un grafo público respaldado por CommandAGI en el que se federa la memoria de cada agente: conocimiento del mundo compartido para que los agentes razonen desde hechos, no solo desde los sesgos de un modelo.
Computadoras en la nube, robots y simulaciones 3D para llevar a cabo el plan, y verlo suceder paso a paso.
Pasos estructurados e inspeccionables que puedes ver, especificar y corregir, en lugar de un vector opaco.
La memoria de cada agente se federa con un grafo de conocimiento público respaldado por CommandAGI: hechos públicos y compartidos, normalizados desde fuentes profesionales heterogéneas en un solo grafo navegable. Abarca el mundo EDA y 3D (KiCad symbols and footprints as graphs, schematic netlists, component datasheets, BOMs), el registro académico (arXiv), el conocimiento abierto (Wikidata, ConceptNet, WordNet, GeoNames) y más, con atribución en cada hecho. Es real hoy y deliberadamente temprano: una base que crece fuente por fuente. Las lecturas lo federan de forma automática; un agente lo aprovecha, pero nunca puede modificarlo.
En qué lo ponen a trabajar
Reproduce un bug en una máquina real, lo corrige, corre las pruebas y abre el PR.
Leer, ejecutar código, graficar resultados y redactar hallazgos con muchas herramientas.
Conciliar hojas de cálculo, abrir tickets, mover datos entre apps que ninguna API conecta.
Editar video, retocar imágenes, armar presentaciones: en las apps de escritorio reales.