> For the complete documentation index, see [llms.txt](https://tinyhumans.gitbook.io/openhuman/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://tinyhumans.gitbook.io/openhuman/zh/gong-neng/native-tools/media-generation.md).

# 图像与视频生成

OpenHuman 可以 *生成* 媒体，而不仅仅是读取它。让助手“生成一张……的图片”、“将这张截图编辑为……”，或者“把这张照片动画化为一个短片”，专门的媒体子代理就会接手。无需插件、无需 API 密钥、无需单独计费。

## 它能做什么

* **图像生成与编辑。** 通过托管的 GMI 模型进行文生图和图像编辑（**Seedream** 用于生成， **SeedEdit** 用于编辑）。
* **视频生成。** 文生视频，或将参考图像动效化为一个短片（**Seedance** / **Veo**）。视频是异步的：代理会启动渲染，并在完成后获取该片段。
* **模型发现。** 代理可以列出当前可用的媒体模型，并为任务选择合适的模型。

## 工作原理

这个 `media_generation` 域（`src/openhuman/media/generation/`）提供三个代理工具（生成图像、生成视频、列出模型），由 OpenHuman 后端的媒体生成提供方支持。后端负责提供方密钥、计费和速率限制；你的订阅会像其他模型调用一样覆盖这些费用。

这些工具会提交任务，然后以 4 秒一次的频率轮询（图像最长 180 秒，视频最长 420 秒），因此代理和你都能获得实时进度，而不是卡住的调用。完成的产物会下载到代理的 `generated-media/` 工作区中的文件夹里，并作为本地文件路径返回，可随时附加、发布或进一步编辑。

## 隐私

这些工具的提示词和参考媒体会发送到 OpenHuman 后端，再转发给托管的媒体提供方。这一点已在应用内能力目录（`intelligence.image_generation` / `intelligence.video_generation`，两者均为 Beta）。请注意 [隐私模式](/openhuman/zh/gong-neng/privacy-and-security/privacy-mode.md)的仅本地执行当前仅覆盖 **推理提供方**。媒体工具仍然会调用后端，因此如果你现在需要严格的无外发，请避免使用它们。将执行范围扩展到集成和网络工具是后续计划中的工作。

## 另请参阅

* [图像工具](/openhuman/zh/gong-neng/native-tools/image-tools.md) 涵盖了 *视觉* 部分：读取和分析图像。
* [可用工具](/openhuman/zh/gong-neng/native-tools.md) 列出完整的原生工具集。
* [计费、成本与使用情况](/openhuman/zh/gong-neng/billing-and-usage.md) 说明媒体任务如何计量。
