能力本身并不够。智能应当展示它的推理过程,接受精确的指示,并始终处于人类的指挥之下。
我们的赌注
一个无法解释自己的模型仍然可能有用,但无法被托付太多。你无法审查它的意图,无法精确说出它本应做什么,也无法确定它明天会做同样的事。每一次对智能的认真使用,最终都会撞上同一堵墙:没有可读性,能力就不够。
我们的赌注是,可读性与能力并不相互对立——让一个智能系统可被检视的那套结构,同样也让它运行得更便宜、部署得更可靠。我们正围绕这个赌注建立这家公司。
关键的一步
渲染是把结构变成你能看见的东西:像素、文字、动作。我们反复回到的洞察是,智能是同一类事物的逆向运行——把结构还原出来,随之而来的行为就不再神秘。感知成了生成的逆过程。一个你能理解的世界,也是一个你能创造的世界。
一旦结构变得显式,你就不必再从提示词里连哄带骗地引出行为、然后祈祷它成功。你可以指定它——说明步骤、约束条件,以及什么算作完成——并让系统对此负责。智能开始表现得像软件:可重复、可审查、可组合、可纠正。
它是为了什么
透明不是奖品。它是前提条件。没有人是为了智能本身而想要智能——人们想要的是现实发生改变:一个彻底修好的 bug,一份获批的许可,一个终于能用的机器人,一个在你不在时仍被看守的地方。智能只是这种改变得以发生的机制。
让这套机制变得可读,它就不再是你与之交谈的东西,而开始成为你指挥的东西。你说出世界应该是什么样子,而我们能触及的计算机、机器人、仿真器与物理系统,就会成为把你的意图带入现实的执行器——每一步都可见、可指定,并且由你负责纠正。
传导
智能可以大幅提升,而世界几乎毫无变化。所有人盯着的那个数字——模型有多强——并没有说明这份能力是否真的触及了任何东西。在一个知道该做什么的系统和一个真正发生改变的世界之间,必须有一套装置:看向真实场景的眼睛、握住真实机器的手、一个能付款的账户、一个别人可以依靠的承诺。这套装置不是部署环节的细节,它决定了这一切是否算数。
这正是我们铺开如此多接触面的原因。一个智能系统能触及多远,不是各项能力的平均值,而是由它完全做不到的那一项决定的。一个推理出色、却什么都看不见、也无法收款的系统,做成的事和什么都不做的系统一样多。我们每纳入一项能力——一块屏幕、一台相机、一个机器人、一个仿真世界、一个账户、一份合约、一种解决分歧的方式——就少一处让整件事停下来的地方。
所以这种广度是刻意为之,而非散乱。这个产品的“收窄版”,会是一个思考得很漂亮、却什么也够不着的系统。
覆盖的广度
这不是一个关于屏幕的狭隘把戏。其背后的信念是,体验与探究都有形状——身处约束之下的系统「感觉如何」,以及一个系统要发现某个真相需要什么,都是你可以描述的结构,而不是你必须接受的谜团。好奇心、注意力、一个智能体赋予「降低自身不确定性」的价值:这些都是几何结构,而不是情绪。
我们并不宣称已经画完那张地图。我们宣称的是这张地图存在——它跨越从单次观察的质感,到一项科学计划的漫长弧线——而哪怕只画出其中一部分,也能让我们构建出对自身所知更加诚实的智能。
我们正在构建的
这个理念被落成产品,分成三层,每一层都刻意保持透明:
为什么是现在
我们相信,智能诚实的那个版本,同时也是高效的那个版本。当理解被结构化,而不是靠蛮力堆出来,产出与运行的成本就会大幅降低——这正是让每一个智能体都拥有一个真实的身体、置身于一个真实的环境,成为普通人也负担得起、而不只是前沿实验室才能负担的东西。
我们正在用数字支撑这个说法。早期的数据令人瞩目;我们要求自己把它们妥善发布出来。查看研究成果。
它如何扩展
一个现实模型的好坏,取决于它的覆盖范围,而覆盖范围正是最昂贵的部分。通常的选择要么是自己拥有传感器,要么是未经询问就获取数据——一支固定摄像头的车队,或是悄悄的爬取。两者都很脆弱,其中一种正是我们努力想要摆脱的姿态。
所以我们把覆盖范围变成了一个市场。当某个地方值得一看,需求方就会把一份请求钉在那个地点;离得最近、想要接下这份工作的人掏出手机,开始直播,并按分钟获得报酬。地球上最密集的传感器网络,就是那个早已在一切事物旁走过的网络——而在这里,它是自愿加入、有偿且可核实的,而不是被攫取的。更好的覆盖带来更好的预测,更好的预测价值更高,也就能支付更多的覆盖。
一个诚实的系统,只能立足于诚实的根基之上,所以即便是数据层,也是经过同意、且有据可查的。价值流向了那个真正在观察的人——这与监控经济恰恰相反,也是我们唯一愿意在其上构建的根基。用直播世界来赚钱。