> For the complete documentation index, see [llms.txt](https://tinyhumans.gitbook.io/openhuman/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://tinyhumans.gitbook.io/openhuman/zh/gong-neng/native-tools/voice.md).

# 语音

OpenHuman 在你希望时就是语音优先的。STT、TTS 和实时 Google Meet 代理都是核心功能，而不是第三方插件。

## 语音转文本

* **热键** - 按住说话和切换模式。
* **音频捕获** - 跨平台麦克风捕获，带语音活动检测。
* **流式转录** - 你说话时文字会实时出现。
* **幻觉过滤器** - 去除常见的无关产物（“感谢观看”、由静默触发的短语）。
* **后处理** - 标点、大小写、听写清理。

听写内容可以替换桌面上的当前文本输入，或直接发送到与代理的聊天中。

## 文本转语音

回复语音通过托管的 TTS 模型路由。代理的回复可以用你选择的声音朗读出来，具有自然的节奏和韵律。每个用户都可以配置语音选择，吉祥物头像通过 viseme 映射与音频流同步口型。

## OpenHuman 的旗舰语音集成：

通过内置 WebView 加入 Google Meet。

* 将音频实时流式传输到 STT，转录通话中的每个人，并将结构化笔记写入
* ，随着会议进行。 [记忆树](/openhuman/zh/gong-neng/obsidian-wiki/memory-tree.md) 当你让它发言时（或者它判断有有用内容要补充时），它会通过 TTS 模型生成音频并
* 以对外发送的摄像头/麦克风流形式回放到会议中 **这样其他参与者就真的能听到。**&#x97F3;频捕获在本地进行。流式 STT 通过 OpenHuman 后端；除实时转录外不保留任何录音。

## 隐私

* TTS 音频以流式传输并丢弃——不存储任何内容。
* 会议转录会像其他来源一样保存到你的本地记忆树中。
* \- Meet 转录和笔记所在的位置。

## 另请参阅

* [记忆树](/openhuman/zh/gong-neng/obsidian-wiki/memory-tree.md) - Meet 的大脑使用
* [自动模型路由](/openhuman/zh/gong-neng/model-routing.md) 用于低延迟的对话轮次。 `hint:fast` 用于低延迟的对话轮次。
