智能体
语音与在场
智能体并不局限于一个聊天框。你可以和它实时对话,它也可以反过来说话、绘图并「现身」——在真实的屏幕上,以一张动画脸的形式,在共享白板上,或作为标识牌。Presence 把任何带屏幕和扬声器的设备,变成一个智能体所在的地方。
和它对话
语音是围绕普通智能体外接的两个可替换外设:语音转文字作为耳朵,文字转语音作为嘴巴。在一个会话中打开麦克风,你就进入了一场全双工对话——智能体能听到你,你也可以随时打断它。服务提供方可配置;默认技术栈无需任何第三方密钥即可运行。
这里的「语音」指的是应用内的实时对话,而不是拨打电话——关于短信与邮件渠道,参见邮件与消息。
让它现身
一台计算机或手机会暴露一个可写的显示界面:写入一次操作,它就会画出来。一套操作集覆盖了智能体能放到屏幕上的一切——在实时界面上叠加一条提示、呈现一个独立场景(一张face、一个 html 页面、一块 whiteboard、一段媒体循环,或另一路摄像头的镜像)、说话,或播放音频。这份操作日志是唯一的真实来源,在设备上和浏览器查看器中渲染出的效果完全一致。
display.jsonl (append)
# Everything an agent puts into the world is one op on the writable display file.
echo '{ "op": "scene", "scene": { "kind": "face" } }' >> display.jsonl
echo '{ "op": "say", "text": "Welcome — how can I help?" }' >> display.jsonl
echo '{ "op": "scene", "scene": { "kind": "whiteboard" } }' >> display.jsonl它解锁了什么
- 一个无需人手值守的柜台——平板上的一张脸负责问候、回答问题,并在超出能力范围时呼叫人工。
- 一块共享白板——智能体用人类会用的同一套操作绘图,并能把白板内容读回为文字。
- 标识牌与状态大屏——一个会话驱动一整支闲置屏幕的车队,每一块都有自己的场景。
- 一部具身化的手机——摄像头作为眼睛,麦克风作为耳朵,手机自己的屏幕上是一张动画脸。
同意与披露
面向外部的输出会触达那些从未打开过应用的人,因此它默认由所有者控制、对外部显示屏默认关闭;智能体的脸会携带 AI 披露标识,房间里的麦克风则始终需要显式开启同意。部署迎宾员的场所自己承担相应的本地披露与同意义务。