CommandAGI
学习价格文档
登录
CommandAGI

愿景、智能与掌控——你可以看见、可以规定、可以信任的智能,在真实环境中行动。

平台

  • 产品
  • 智能
  • 感知
  • 预见
  • 机器人技术
  • 协调
  • 3D 打印
  • 服务
  • 商店
  • 站点
  • 定价

探索

  • 世界
  • 会话
  • 学习 CommandAGI
  • 文档
  • 演示
  • 获取应用
  • 开创事业
  • 指令经济
  • 生态系统
  • 机会基金
  • 用手机赚钱
  • 储备金证明
  • 状态

公司

  • 正直
  • 信任与可验证性
  • 关于我们
  • 愿景
  • 研究
  • 博客
  • 品牌
  • 联系我们

法律

  • 隐私
  • 条款
  • 短信订阅
  • Cookie
  • 全部法律文件
© 2026 CommandAGI INC。保留所有权利。 · 符合 GDPR 与 CCPA · SOC 2 认证进行中
条款隐私Cookie状态

Canvas Engineering

为逆向扩散潜空间动力学声明的因果宏观结构

作者:Jacob Valdez

Canvas Engineering 论文首页——标题、作者、图 1 与摘要。
阅读

如果你能把任意问题域的因果结构直接映射到神经几何本身,会怎样?当今的世界模型是在对一袋扁平的 token 去噪:一切都可以注意到一切,模型最终用上的结构由它自己摸索出来,埋在你读不懂的权重里。Canvas Engineering 押的是相反的一注——它是面向逆向扩散潜空间动力学的提示工程。结构由你预先声明,再由编译器把它变成精确的事实。

你在扩散画布上铺开一个个具名区域,声明哪些区域才被允许影响哪些区域、每个区域多久更新一次、以及各自在损失中扮演什么角色。编译器把这一切下译为一个现成预训练扩散 Transformer 上的注意力掩码、损失权重与帧映射。结果是:逆向扩散不再均匀地作用于一袋扁平 token,而是由你声明的连通性决定只有特定块之间才能相互影响。这条硬约束在逆向扩散动力学内部诱导出一张显式的、人可阅读的因果图。

左侧是一段 CanvasLayout 与 CanvasTopology 的声明;右侧是编译器把它接成一张排布好的画布,并带有信息流箭头。
你声明,编译器接线。区域成为时空网格上类似结构体的偏移,每条声明的 Connection 都成为一条获准的注意力边——一支你可以指着看的信息流箭头。

分工:接线由你固定,权重由梯度学习

分工非常明确。你固定一条边是否存在、它的方向,以及它的时间跨度。梯度——由数据或内在损失驱动——决定沿每条边流动的是什么,以及区域内部发生的一切。符号层管宏观,神经层管微观。

而且两层之间没有接口,因为符号层本身就是注意力掩码。如果两个区域之间没有通路,它们的独立性就是构造上精确成立的——这是一条硬禁令,而不是模型可能学会绕过的正则化惩罚。缺失的边给出精确的边缘独立性;你只要读图,就能证明一个区域无法影响另一个。

左:一个 3x3 的分块矩阵,表示哪些区域可以注意哪些区域,其中动作到视觉是开的,视觉到动作是关的。右:在 186 个已分配位置上真实编译出的注意力掩码。
拓扑就是掩码。左:分块结构——深色单元格是获准的边,而且它是不对称的(动作 → 视觉开,视觉 → 动作关)。右:在已分配潜位置上真正编译出的掩码,其中视觉区域远远盖过动作与奖励。

这样看,熟悉的架构都成了特例。标准的马尔可夫扩散策略不过是一张两节点画布:(观测) → 动作,以及(观测 + 动作) → 下一步观测。多智能体协同的零件更多,却同样干净——每个智能体在自己的观测与动作上自注意,智能体之间只通过你声明的跨区域边协同。拓扑就是协同协议,以数据的形式写出来。

左:现实世界中四台机器人围绕一项共享任务,带视锥与运动箭头。右:同一份因果结构被编译到画布上,成为各智能体的观测/动作区域,并通过一个共享的调度区域协同。
多智能体的两面:世界中真实存在的因果结构(左)与编译器据此构建的画布(右)是同一个对象。每台机器人的策略都是观测 → 动作;它们只在声明的共享区域相遇。

用代码声明:schema 编译成画布

手工分配潜空间地盘并不可扩展。所以还有更高的一层:canvas engineering 库是一个面向类型化 schema 声明的编译器。你把因果结构写成一个普通的 Python 对象——带字段、损失权重与更新时钟的嵌套类型化 dataclass——然后由 compile_schema() 替你摊平成区域与注意力掩码。复杂关系被显式、透明地声明出来,写在你可以逐行审阅的代码里。

为了给它加压,我们描述了一间医院 ICU 病区的大尺度结构:六名有器官级生理指标的病人、四名带疲劳动力学的护士、保险与人力压力,以及家庭单元。一次 compile_schema() 调用就在画布上分配并打包了 199 个区域与 1077 条连接——heart_rate 每帧更新,creatinine 每 24 帧更新,各自按声明的时钟走。

三块面板:一间 ICU 病区的组合式 pydantic schema;它所指称的因果图,含一条声明的脓毒症通路;以及编译出的 199 个区域、1077 条连接的画布,其中标出了 patients[2] 与 nurses[1] 等具体区域。
一份声明,三种忠实的视图:你写下的 schema(左)、它所指称的因果图及声明的肾 → 心 → 神经脓毒症通路(中),以及自动打包出的 199 个区域、1077 条连接的画布(右)。扁平模型学到的会是相关性;画布模型则被迫沿着声明的因果通路走。

关键在于,每个区域、每条边都是一个你可以回读的决定。下面是同一份声明的病区连通性的三种视图,各自高亮一条不同的连边——护士的动作跨帧改变病人、状态喂给风险、状态随时间延续——并各自标注了它存在的因果理由。你不必再靠探针去反推模型碰巧学到了什么;图是你写的。

一张三帧画布,展示一条声明的“护士动作到病人状态”的跨时间边,并标注理由:护士的动作会在下一步实质性地改变病人的生理状态。
同一病区中被高亮的一条边:护士 → 病人,跨帧生效,因为护士的动作会在下一步实质性地改变病人的生理状态。这条边编码了一个已知的因果效应——而它之所以可读,是因为它由你声明。

潜张量是可寻址的

这份可读性指向一个更深的性质。画布 schema 与 C 语言 struct 的语义是对应的:区域边界是结构体偏移,拓扑是调用约定,序列化后的 schema 就是一份 ABI。潜张量因此变得可寻址——你能准确指出哪些位置是 nurses[1] 并把它们读出来。这是给编译器用的内存映射,只不过发生在潜空间扩散画布上。

于是共享同一份 schema 的两个模型可以直接交换潜状态——不用分词,也不用重新编码。当扩散只是 GPU 上的一段 torch 时,这没什么可激动的;但当你必须把为生成猫咪视频而优化的硅片改造去干正经活时,它就要紧了:共享 ABI 正是你在芯片之间搬运潜状态、而中间不插一次解码/编码往返的方式。

唯一的存在性证明:皮层

这个框架把我们带得更接近通用智能唯一的概念验证——人脑。许多神经科学家长期主张,皮层的功能连接反映了其所处环境的因果结构。而这种分工也很眼熟:大尺度功能连接(宏观接线)在很大程度上由连接组指定、实际上是固定的,而微观权重则由突触可塑性在一生中调整。拓扑固定,权重习得。这正是 Canvas Engineering 所做的分工。

凑近看,一张皮层连接矩阵和一张画布注意力掩码是同一个对象:源 × 目标、网络内部分块对角、跨网络是稀疏而具体的边,且每个单元格都带着自己的算子类型。连接组就是一份画布拓扑。

一张覆盖 23 个 Destrieux 区域的皮层画布连接矩阵,按源与目标排列,在各网络(视觉、听觉、语言、额叶、默认模式、皮层下)内部分块对角,跨网络的边稀疏,每个单元格都标有算子类型。
一张以画布拓扑呈现的皮层连接矩阵:23 个 Destrieux 区域,源 × 目标,在每个功能网络内部分块对角,跨网络则是稀疏而具体的边。颜色是连接权重,单元格中的文字是算子类型。它与上面那张注意力掩码是同一类对象。

为了检验这一主张,我们把 23 个 Destrieux 区域按 42 条已知皮层通路连了起来——主要在默认模式回路、腹侧视觉通路、A1 → Wernicke → Broca,以及前额叶 → 前运动皮层 → 运动皮层——并用 Meta 的 TRIBE v2 脑编码器给出的真实皮层预测来训练。声明拓扑的画布在单时间步动力学上饱和于 R² = 0.825,以19.6% 的连接量和大约 5× 的训练速度追平了全稠密模型。在这里,拓扑是收敛先验,而不是容量优势。

两张柱状图。左:预测真实的 TRIBE v2 皮层动力学,皮层画布 R2=0.825、仅用 19.6% 的接线,追平 R2=0.826 的稠密模型。右:基于虚拟 EEG 的脑机接口解码,画布解码器 69%,SVM 59%,随机水平 25%。
皮层画布以 1/5 的接线量和 5× 的速度,追平了全稠密模型的精度(R² = 0.825 对 0.826);从该模型读出的四分类脑解码达到 69%(线性 SVM 为 59%,随机水平 25%)。拓扑是收敛先验,而不是更多容量。

如果这一段还没打通,值得在此停一停——机器学习各自为政,而向神经科学学习能省下大量时间。(生物学从来不像它的任何一个模型那样简单;这是一条值得画出的联系,而不是在断言皮层就是一个扩散 Transformer。)还有很多要展开的,我们会继续。

测量结果究竟说明了什么

实证记录是刻意诚实的。在 CogVideoX-2B 上基于 BridgeData V2 的 26 组实验、236 次训练中,最醒目的是一项关于循环注意力的研究——用习得的迭代嵌入反复迭代冻结的扩散 Transformer 块。一个仅有 35 万可训练参数的冻结三循环配置,胜过了所有 1170 万参数的非冻结配置——参数效率 1.73×,p < 0.001,且循环表示收敛到不动点。

动作损失柱状图(越低越好):冻结的 35 万参数三循环配置为 0.073,优于半冻结 370 万参数的 0.107 与非冻结 1170 万参数的 0.088。
循环注意力:冻结骨干加 3 个循环、35 万可训练参数,取得了最低的动作损失(0.073),胜过一个 1170 万参数的非冻结模型——可训练参数少 33×,结果却最好。

有三条校准让这个故事保持诚实:

  1. 在这个规模上,循环带来的好处是权重共享式的正则化,而不是可检测的迭代推理。我们照实说。
  2. 结构必须被声明:让各模态扁平地共处一处,会让联合预测退化 19%(p < 0.0001)。把 token 塞进同一个张量并不是结构,拓扑才是。
  3. 画布设计是宽容的——损失对 token 究竟怎么分配几乎不敏感(α = 0.011)。你要做对的是图,而不是像素预算。

有两条边界我们始终守住:ICU 与空管的设计是架构演示,而非经过验证的临床或运行系统;皮层模型预测的是一个脑编码器的输出,而不是直接测得的神经活动。

还有哪些悬而未决

关键一环是表示稳定性:schema 中介的潜状态交换、迁移距离标定、即插即用的模态,全都假定相同的声明结构会在不同随机种子与不同骨干上诱导出可预期地对齐的几何。这看似合理,但尚未证明。再往后:一次决定性的消融,比较声明拓扑与扁平拓扑在绑定问题上的差别;当数据与参数规模越过 2B 之后,声明结构是否还继续兑现;以及习得拓扑——在稀疏先验下提议并剪除边,把声明的 schema 当作先验而非定论。

上手试试

Canvas Engineering 把符号产物变成一份 schema——一套面向潜空间计算的类型系统——其执行就是现成扩散 Transformer 内部的掩码注意力,从而消解了神经与符号的边界。论文里有完整推导、若干做透的设计(操作、车队、空管、ICU、皮层),以及全部实验档案。

代码库

一个 Apache-2.0 编译器,把由区域、连通性与更新时钟组成的类型化 schema,下译为现成预训练扩散 Transformer 上的注意力掩码。附带可直接运行的示例:cartpole、车队、医院模型与脑连接。

pip install canvas-engineering
from canvas_engineering import compile_schema, CanvasModel

# Declare the causal macrostructure; the compiler lays it out.
canvas = compile_schema(MySchema)          # regions + attention mask
model = CanvasModel.from_pretrained("cogvideox-2b", canvas=canvas)

model.fit(dataset)                          # gradients learn the weights
state = model.rollout(obs)                  # you fixed the wiring
阅读论文(PDF)代码文档与可运行示例

引用格式:Valdez, J. Canvas Engineering: Declared Causal Macrostructure for Reverse-Diffusion Latent Dynamics. CommandAGI Technical Report,2026年7月8日。

更多研究