实时吉祥物
OpenHuman 的屏幕化身:一个桌面吉祥物,会说话、会反应、会加入你的会议,即使你没在看它,也会在后台思考。
OpenHuman 有一张脸。这个吉祥物是一个驻留在你的桌面上的动画角色,作为智能体的可见外表:它在说什么、在想什么、何时空闲、何时忙碌、何时有话要告诉你。
它不是一个花哨的摆件。这个吉祥物接入了与智能体其他部分相同的组件:语音、记忆,以及 潜意识循环,以及 Google Meet 集成. 当智能体在说话时,是吉祥物在说话;当智能体在思考时,是吉祥物在思考。
功能
它会说话,并与自己的声音进行口型同步
当智能体回复时,音频通过托管的 TTS 模型生成并流式传输到你的扬声器。同时,吉祥物会根据音频驱动一个 viseme 映射,让嘴型与说出的词语一致。这里没有单独的“说话头像”视频,驱动动画的就是你听到的同一音频流。
另见 原生语音 用于语音转文字、文字转语音,以及吉祥物所依赖的会议底层管道。
它作为真实参会者加入你的会议
这个吉祥物是 OpenHuman 的旗舰语音集成。它可以作为真实参会者加入 Google Meet 通话:它听见每个人的发言,将笔记记录到你的 记忆树,当它有话要说时会在通话中开口回应,并将自己的动画面孔作为摄像头画面传入会议。
这是最核心的用例,并且有单独的页面,见 会议代理.
它会移动并对周围环境作出反应
这个吉祥物有情绪状态(空闲、思考、倾听、说话、惊讶、做梦),并会根据智能体正在做什么在这些状态之间切换。当你开始输入时,它会切换到倾听姿态。当模型在推理时,它会表现出来。当某个工具调用返回了值得注意的结果时,它会作出反应。当你有一阵子不再交互时,它会进入空闲状态。
在一轮对话结束后,桌面吉祥物还会读取随聊天结果到达的会话级提示。成功提示会产生一个简短的开心回应,不确定性会产生困惑的回应,而警告或失败结果会产生担忧的回应。如果没有明显提示,它会保持现有的平静轮后回应并回到空闲。
它的目标是让人感觉有生命,而不是按脚本机械动画。
它记得你
这个吉祥物是某个智能体的可见部分,而该智能体拥有 记忆树 作为底层能力。它会记住你们谈过什么、你生活中的人是谁、你手头有哪些待办、已经决定了什么,以及还有哪些未完成的事情,跨越你连接的每一个来源。当它早晨向你问好时,它并不是从零开始。
正是这种记忆让个性在数周和数月里保持一致。你今天对话的吉祥物知道上周二你对话的那个吉祥物所知道的一切。
它在后台思考,也就是潜意识
即使你停止输入,吉祥物也会继续思考。 潜意识循环 是一个后台 tick,它会:
加载你的常驻任务和环境目标。
读取你工作区的当前状态和最近记忆。
决定如何处理每一项(自主执行、暂缓,或升级给你审批)。
将结果写回你可以审计的活动日志。
所以当你回到桌前时,吉祥物可能已经起草好了邮件、刷新了仪表盘,或者排好了它需要向你提问的问题。屏幕上的那张脸就是完成这些工作的那一个。
它会做梦
当你离开足够久时,吉祥物会进入做梦状态。做梦是智能体的离线整合阶段,会把当天的碎片提炼成更长周期的摘要,更新那些已经变得活跃的实体的主题树,并浮现出不属于任何单一来源的模式。吉祥物在做梦时会以不同的方式动画显示,这样你一眼就能看出:它不是空闲,而是在处理。
当你回来时,这些梦境已经被纳入记忆树。吉祥物醒来时比入睡前更聪明。
为什么要有吉祥物?
大多数助手只是一个闪烁的文本输入框。作为工具这没问题。但对于一种要整天陪伴你、持续记住你的生活并代表你采取行动的东西来说,这就不够了。
吉祥物之所以存在,是因为:
存在感胜过面板。 你只需瞥一眼一张脸,就能在一帧里看出智能体是在忙碌、空闲、做梦,还是想引起你的注意。
它让语音通话像在对话。 一个动画角色的摄像头画面并与自己的语音口型同步,和一个机器人声音配黑色方块的体验截然不同。
个性本身就是一种 UX 表层。 屏幕上一个一致的角色,比一个没有面孔的 API 更容易让人信任、交谈,以及在它出错时原谅它。
另请参阅
会议代理,Google Meet 中的吉祥物:倾听、说话、动画展示、使用工具。
原生语音,吉祥物所依赖的 STT / TTS 底层管道。
记忆树,吉祥物记住了什么,以及如何记住。
潜意识循环,在你离开时它会思考什么。
Chromium 嵌入式框架,摄像头接入 Meet 的管道(开发者参考)。
最后更新于