语音
原生语音——语音转文字输入、文字转语音输出、吉祥物口型同步,以及可实时收听和发言的 Google Meet 代理。
OpenHuman 在你希望时就是语音优先的。STT、TTS 和实时 Google Meet 代理都是核心功能,而不是第三方插件。
语音转文本
热键 - 按住说话和切换模式。
音频捕获 - 跨平台麦克风捕获,带语音活动检测。
流式转录 - 你说话时文字会实时出现。
幻觉过滤器 - 去除常见的无关产物(“感谢观看”、由静默触发的短语)。
后处理 - 标点、大小写、听写清理。
听写内容可以替换桌面上的当前文本输入,或直接发送到与代理的聊天中。
文本转语音
回复语音通过托管的 TTS 模型路由。代理的回复可以用你选择的声音朗读出来,具有自然的节奏和韵律。每个用户都可以配置语音选择,吉祥物头像通过 viseme 映射与音频流同步口型。
OpenHuman 的旗舰语音集成:
通过内置 WebView 加入 Google Meet。
将音频实时流式传输到 STT,转录通话中的每个人,并将结构化笔记写入
,随着会议进行。 记忆树 当你让它发言时(或者它判断有有用内容要补充时),它会通过 TTS 模型生成音频并
以对外发送的摄像头/麦克风流形式回放到会议中 这样其他参与者就真的能听到。音频捕获在本地进行。流式 STT 通过 OpenHuman 后端;除实时转录外不保留任何录音。
隐私
TTS 音频以流式传输并丢弃——不存储任何内容。
会议转录会像其他来源一样保存到你的本地记忆树中。
- Meet 转录和笔记所在的位置。
另请参阅
最后更新于