把开放式目标拆解为可在环境中执行的具体动作。
直接操控机器——鼠标、键盘、终端、浏览器、应用、执行器。
观察变化,从死路中恢复,持续推进直至完成。
多数模型是一个黑盒:输入目标,输出动作,中间步骤只是一段无法查看的向量。000 系列把推理保留为结构——你可以看到它为什么这样做,指定它下次该怎么做,并在错误变成动作之前发现它。
从原始像素中提取出带类型的屏幕模型——窗口、按钮、输入框。无需 DOM。
每个动作都对照它实际造成的变化进行核查。不掩盖任何问题。
控件的作用从经验中学得;识别能力在线校准到你的应用。
说明它本该怎么做,纠正就会生效——下一次运行遵循你的规格说明,而不是再赌一次运气。
大语言模型带来流畅的推理和广博的世界知识。我们带来它们所缺的三样东西:直接从像素读取结构的具象感知、可供推理的专业知识图谱,以及可真正行动的真实计算机、机器人和 3D 世界。让前沿模型接入我们这一层,它便不再猜测屏幕与世界——它能看见、回忆并执行。
从原始像素生成带类型的场景图——屏幕上或房间里有什么,以模型可行动的结构呈现,每个节点都可追溯到其来源图块。
由 CommandAGI 支持的公共图谱,每个智能体的回忆都联邦接入其中——共享的世界知识,让智能体依据事实推理,而不只是模型的先验。
云端计算机、机器人和 3D 仿真来执行计划——并逐步观看它发生。
结构化、可查看的步骤,你能看见、指定并纠正——而不是一段黑盒向量。
每个智能体的记忆检索都会联合查询由 CommandAGI 支持的公共知识图谱——把异构专业来源的公开共享事实归一化为一张可导航的图谱。它覆盖 EDA 与 3D 领域(KiCad symbols and footprints as graphs, schematic netlists, component datasheets, BOMs)、学术文献(arXiv)、开放知识(Wikidata, ConceptNet, WordNet, GeoNames)等等,每条事实都带有来源标注。它今天已经可用,也有意还处于早期——这是我们逐个来源扩充的基线。读取时会自动联合查询;智能体可以调用它,但永远无法修改它。
人们用它来做什么
在真实机器上复现缺陷、修补代码、运行测试、提交 PR。
跨多种工具阅读文献、运行代码、绘制图表并撰写结论。
核对表格、提交工单,在没有 API 相连的应用间搬运数据。
剪视频、修图、排版演示稿——都在真实的桌面应用里。