MiniMax H3 · 开放通用多模态视频模型

MiniMax H3 AI 视频生成模型

MiniMax H3 是 MiniMax 的开放通用多模态视频模型,统一理解文字、图片、视频和音频,支持 768P/2K、24 fps、4 到 15 秒视频生成,并可完成参考生成与视频编辑。

MiniMax H3 可开始创作

支持文字生视频、图生视频、首尾帧控制和多模态参考生成。

提示词示例
模型概览

什么是 MiniMax H3?

MiniMax H3 是 MiniMax 的开放通用多模态视频模型。它把文字、图片、视频和音频放进统一上下文,支持文字生视频、图生视频、首尾帧控制、参考生成和视频编辑。

根据 MiniMax 官方发布资料,H3 可生成 768P 或最高 2K、24 fps 的 4 到 15 秒视频,并支持原生立体声;它面向广告、品牌、电商、产品设计、UI/UX 和游戏等商业内容创作场景。

通过参考图片、视频和音频,H3 可以理解主体、动作、镜头、风格与声音之间的关系。你可以用自然语言说明参考素材与目标画面的关系,让一次生成处理多种输入。

API 模型 IDMiniMax-H3
模型类型开放通用多模态视频模型
输出规格768P / 2K · 24 fps
视频时长4–15 秒(整秒)
使用方式

如何用 MiniMax H3 生成视频

从提示词、首尾帧或参考素材开始,创建并精修一段多模态视频。

01

选择生成模式

根据任务选择文字生视频、首尾帧图生视频或参考生成。

02

添加参考素材

添加首帧或尾帧,或上传图片、视频和音频参考;混合输入最多 12 个文件。

03

写下提示词

说明主体、镜头、动作、声音,以及参考素材与目标画面之间的关系。

04

生成并精修

提交异步任务并查看结果,再通过视频编辑或再生成继续完善成片。

官方技术规格

为多模态视频创作而生

原生立体声音频

视频生成可同时产生与画面匹配的原生立体声音频

768P / 2K分辨率

支持 768P 与最高 2K 输出,帧率为 24 fps

4–15 秒视频时长

每次生成按整秒指定时长

开放模型模型类型

MiniMax 官方定义的开放通用多模态视频模型

文字 + 图片 + 视频 + 音频统一上下文

在同一次任务中理解多种模态输入及其关系

9 + 3 + 3参考输入

最多 9 张图片、3 段视频和 3 段音频;混合输入最多 12 个文件

首帧 + 尾帧帧控制

使用 0、1 或 2 张图片控制镜头的起始和结束画面

7,000提示词长度

API 提示词上限为 7,000 个字符

核心能力

一个模型,覆盖更多视频创作任务

01原生立体声

视频与声音共同生成

H3 将视频与原生立体声音频放在同一套生成流程中,适合需要对白、音效、音乐和环境氛围的完整镜头。

开始体验
02统一多模态上下文

文字、图片、视频和音频一起理解

用自然语言描述参考素材之间的关系,H3 可以同时参考主体、动作、镜头、风格和声音,支持多模态参考生成与视频编辑。

开始体验
03商业内容创作

从广告到产品设计

MiniMax 官方资料提到 H3 在指令遵循、文字与品牌呈现、视频到视频的运动迁移方面表现突出,适用于广告、品牌、电商、产品设计、UI/UX 和游戏。

开始体验
生成模式

MiniMax H3 支持的生成模式

根据 MiniMax 官方 API 文档,H3 支持从文字、首尾帧和多模态参考素材创建或编辑视频。

模式输入典型用途
文字生视频提示词从文字描述生成视频
首帧 / 尾帧图生视频提示词 + 首帧和/或尾帧图片控制开场或结尾画面,让静态图像自然动起来
参考生成提示词 + 参考图片、视频或音频参考主体、动作、镜头、风格、声音或剪辑节奏
视频编辑与再生成提示词 + 已有视频修改视频,或将符合规格的 768P 结果再生成到 2K
API

MiniMax H3 输入限制

参考图片≤9 张 · 256–5760 px · 单张 ≤30 MB
参考视频≤3 段 · 单段 2–15 秒 · 总计 ≤15 秒 · 单个 ≤50 MB
参考音频≤3 段 · 单段 2–15 秒 · 总计 ≤15 秒 · 单个 ≤15 MB
混合参考图片、视频和音频合计 ≤12 个;音频需搭配图片或视频
首帧 / 尾帧0–2 张 · 256–5760 px · 比例 2:5–5:2
输入格式视频 H.264/H.265 · 图片 JPG/JPEG/PNG/WEBP/HEIC/HEIF
音频格式WAV、MP3
请求体≤64 MB · 提示词 ≤7,000 字符
提示词示例

让提示词动起来

用这些提示词开始创作电影感片段;本地演示视频为示意性的库存素材,提示词可用于广告、品牌和叙事创作。

城市轨道列车

提示词

通勤列车驶过高架城市轨道,电影感长焦镜头。

落日海面

提示词

夕阳下海鸟掠过平静海面,金色倒影铺在水上。

雨中山路

提示词

镜头沿着乌云下蜿蜒的山路前进,安静的电影感旅行画面。

穿越虫洞

提示词

抽象隧道中打开一道发光的传送门,光线朝镜头奔涌而来。

黄昏片刻

提示词

一位女性在黄昏户外停下脚步,柔和的散景,沉思的情绪。

夜色威尼斯

提示词

小船缓慢穿过夜晚的历史运河,温暖的城市灯光倒映在水面。

FAQ

MiniMax H3 常见问题

什么是 MiniMax H3?

MiniMax H3 是 MiniMax 的开放通用多模态视频模型,统一理解文字、图片、视频和音频输入,支持视频生成、参考生成和视频编辑。

MiniMax H3 支持哪些输入?

H3 支持文字提示词、图片、视频和音频输入,可用于文字生视频、首尾帧图生视频以及多模态参考生成。

MiniMax H3 可以生成多长、什么分辨率的视频?

官方 API 文档显示,H3 支持 768P/2K 输出、24 fps,单次生成时长为 4 到 15 秒,并按整秒指定。

H3 会生成声音吗?

会。MiniMax 官方发布资料将 H3 描述为可生成带原生立体声的多模态视频模型,声音与视频在同一生成流程中完成。

什么是 MiniMax H3 的参考生成?

参考生成可以在一次任务中使用参考图片、视频或音频,让模型理解主体、动作、镜头、风格、声音或剪辑节奏,并按提示词生成目标视频。

MiniMax H3 支持多少参考素材?

最多可使用 9 张参考图片、3 段参考视频和 3 段参考音频,混合输入最多 12 个文件;音频参考需要与图片或视频输入一起使用。

MiniMax H3 是开源模型吗?

MiniMax 官方将 H3 定义为开放通用多模态视频模型,并提供开放权重。开放权重不等同于训练数据、全部代码和所有组件都以开源许可发布。

如何调用 MiniMax H3 API?

使用模型 ID MiniMax-H3 提交异步视频生成任务,收到 task_id 后轮询任务状态;任务成功后,从响应中的 content.url 获取视频。

MiniMax H3

把多模态想法变成可用视频。

用文字、图片、视频或音频描述创意,让 MiniMax H3 生成带原生立体声的 768P/2K 视频,再继续编辑和精修。

立即体验 MiniMax H3

官方资料与参考

本页规格和能力描述基于 MiniMax 官方 H3 发布文章、视频 API 指南和模型总览。

示例视频使用本地托管的 Mixkit 免费库存素材。本页面为独立资源,与 MiniMax 没有隶属关系。

规格核对日期:2026 年 8 月 4 日