选择生成模式
根据任务选择文字生视频、首尾帧图生视频或参考生成。
MiniMax H3 是 MiniMax 的开放通用多模态视频模型,统一理解文字、图片、视频和音频,支持 768P/2K、24 fps、4 到 15 秒视频生成,并可完成参考生成与视频编辑。
MiniMax H3 是 MiniMax 的开放通用多模态视频模型。它把文字、图片、视频和音频放进统一上下文,支持文字生视频、图生视频、首尾帧控制、参考生成和视频编辑。
根据 MiniMax 官方发布资料,H3 可生成 768P 或最高 2K、24 fps 的 4 到 15 秒视频,并支持原生立体声;它面向广告、品牌、电商、产品设计、UI/UX 和游戏等商业内容创作场景。
通过参考图片、视频和音频,H3 可以理解主体、动作、镜头、风格与声音之间的关系。你可以用自然语言说明参考素材与目标画面的关系,让一次生成处理多种输入。
从提示词、首尾帧或参考素材开始,创建并精修一段多模态视频。
根据任务选择文字生视频、首尾帧图生视频或参考生成。
添加首帧或尾帧,或上传图片、视频和音频参考;混合输入最多 12 个文件。
说明主体、镜头、动作、声音,以及参考素材与目标画面之间的关系。
提交异步任务并查看结果,再通过视频编辑或再生成继续完善成片。
视频生成可同时产生与画面匹配的原生立体声音频
支持 768P 与最高 2K 输出,帧率为 24 fps
每次生成按整秒指定时长
MiniMax 官方定义的开放通用多模态视频模型
在同一次任务中理解多种模态输入及其关系
最多 9 张图片、3 段视频和 3 段音频;混合输入最多 12 个文件
使用 0、1 或 2 张图片控制镜头的起始和结束画面
API 提示词上限为 7,000 个字符
根据 MiniMax 官方 API 文档,H3 支持从文字、首尾帧和多模态参考素材创建或编辑视频。
| 模式 | 输入 | 典型用途 |
|---|---|---|
| 文字生视频 | 提示词 | 从文字描述生成视频 |
| 首帧 / 尾帧图生视频 | 提示词 + 首帧和/或尾帧图片 | 控制开场或结尾画面,让静态图像自然动起来 |
| 参考生成 | 提示词 + 参考图片、视频或音频 | 参考主体、动作、镜头、风格、声音或剪辑节奏 |
| 视频编辑与再生成 | 提示词 + 已有视频 | 修改视频,或将符合规格的 768P 结果再生成到 2K |
用这些提示词开始创作电影感片段;本地演示视频为示意性的库存素材,提示词可用于广告、品牌和叙事创作。
复制精选提示词,开始创作多模态 AI 视频。
MiniMax H3 是 MiniMax 的开放通用多模态视频模型,统一理解文字、图片、视频和音频输入,支持视频生成、参考生成和视频编辑。
H3 支持文字提示词、图片、视频和音频输入,可用于文字生视频、首尾帧图生视频以及多模态参考生成。
官方 API 文档显示,H3 支持 768P/2K 输出、24 fps,单次生成时长为 4 到 15 秒,并按整秒指定。
会。MiniMax 官方发布资料将 H3 描述为可生成带原生立体声的多模态视频模型,声音与视频在同一生成流程中完成。
参考生成可以在一次任务中使用参考图片、视频或音频,让模型理解主体、动作、镜头、风格、声音或剪辑节奏,并按提示词生成目标视频。
最多可使用 9 张参考图片、3 段参考视频和 3 段参考音频,混合输入最多 12 个文件;音频参考需要与图片或视频输入一起使用。
MiniMax 官方将 H3 定义为开放通用多模态视频模型,并提供开放权重。开放权重不等同于训练数据、全部代码和所有组件都以开源许可发布。
使用模型 ID MiniMax-H3 提交异步视频生成任务,收到 task_id 后轮询任务状态;任务成功后,从响应中的 content.url 获取视频。
本页规格和能力描述基于 MiniMax 官方 H3 发布文章、视频 API 指南和模型总览。
示例视频使用本地托管的 Mixkit 免费库存素材。本页面为独立资源,与 MiniMax 没有隶属关系。
规格核对日期:2026 年 8 月 4 日