For the complete documentation index, see llms.txt. This page is also available as Markdown.

语音

原生语音——语音转文字输入、文字转语音输出、吉祥物口型同步,以及可实时收听和发言的 Google Meet 代理。

OpenHuman 在你希望时就是语音优先的。STT、TTS 和实时 Google Meet 代理都是核心功能,而不是第三方插件。

语音转文本

  • 热键 - 按住说话和切换模式。

  • 音频捕获 - 跨平台麦克风捕获,带语音活动检测。

  • 流式转录 - 你说话时文字会实时出现。

  • 幻觉过滤器 - 去除常见的无关产物(“感谢观看”、由静默触发的短语)。

  • 后处理 - 标点、大小写、听写清理。

听写内容可以替换桌面上的当前文本输入,或直接发送到与代理的聊天中。

文本转语音

回复语音通过托管的 TTS 模型路由。代理的回复可以用你选择的声音朗读出来,具有自然的节奏和韵律。每个用户都可以配置语音选择,吉祥物头像通过 viseme 映射与音频流同步口型。

OpenHuman 的旗舰语音集成:

通过内置 WebView 加入 Google Meet。

  • 将音频实时流式传输到 STT,转录通话中的每个人,并将结构化笔记写入

  • ,随着会议进行。 记忆树 当你让它发言时(或者它判断有有用内容要补充时),它会通过 TTS 模型生成音频并

  • 以对外发送的摄像头/麦克风流形式回放到会议中 这样其他参与者就真的能听到。音频捕获在本地进行。流式 STT 通过 OpenHuman 后端;除实时转录外不保留任何录音。

隐私

  • TTS 音频以流式传输并丢弃——不存储任何内容。

  • 会议转录会像其他来源一样保存到你的本地记忆树中。

  • - Meet 转录和笔记所在的位置。

另请参阅

最后更新于