MiniMax H3
MiniMax H3 是 MiniMax 的通用多模态生成模型。在 JIUFENG 工作台中,它接受文字描述、首帧图片,或参考图、参考视频与参考音频,输出 768P / 2K、24 帧/秒、带立体声的视频,按秒计费。
模型概览
MiniMax H3 是 MiniMax 发布的通用多模态生成模型,官方定位是在文字、图像、视频与音频之间统一理解上下文,并据此生成画面与声音。JIUFENG 工作台接入了它的视频生成能力,三种起手方式:仅凭文字描述生成;以一张图确定首帧、画面自该帧继续(可再给一张尾帧);或提供参考图、参考视频与参考音频,让模型参照其中的主体、动作与声音。生成在服务端完成,成片进入你的作品记录。
三种起手方式对应不同的控制程度。只给文字时,构图与运动都由模型决定;给定首帧时,画面内容由这一帧确定,模型只生成其后的运动;参考素材则介于两者之间,用已有素材约束主体与风格,而不锁死每一帧。音轨与画面一次生成,无需另行配音。工作台与 API 的能力面一致,只有默认值不同:经 API 调用时不传 resolution 默认为 2K,工作台默认 768P。
工作台选项
文字描述
描述画面的主体、动作与环境。任何一种起手方式都需要它。
首帧与尾帧
以一张图确定视频的第一帧,画面自该帧继续;可再给一张尾帧。
参考素材
参考图、参考视频与参考音频,让模型参照其中的主体、动作与声音。与首/尾帧不能同时使用。
档位与时长
提交前选择输出规格与时长,两者共同决定本次消耗。
官方声明的强项
指令遵循
官方将指令遵循列为该模型的强项之一。适用于对主体、动作与镜头有明确要求的描述。
画面与声音同时生成
音轨随画面一次生成,环境声与画面动作对应,不需要额外的配音步骤。
文字与品牌标识
官方另将文字与品牌标识的准确呈现列为强项。适用于带字幕、招牌或包装的镜头。
商业内容创作
官方称其面向广告、品牌、电商与产品设计等商业内容创作场景。
示例
下面每条都对应上面提到的一项能力,点开可以直接看效果(含声音)。
如何生成视频
- 打开已选中该模型的创作空间,描述主体、动作和镜头运动,再选择纯文字、首尾帧或参考素材作为输入。
- 选择输出尺寸和时长。首尾帧与参考素材是两种不同模式,按当前选择核对预估积分。
- 登录后提交视频生成。完成后播放并检查画面和声音,再调整提示词或输入素材进行下一次尝试。
使用建议
- 输出规格与时长共同决定本次消耗,两者都在提交前选择。验证方向时用较低档位与最短时长。
- 描述中写明运动方式(镜头推进、人物转身、水面起伏),而不只描述静态的画面内容。
- 需要精确控制画面内容时,先生成一张静帧图片,再以该图作为首帧。
- 参考视频的时长会按输出同价并入计费秒数:传一段 10 秒素材出一条 5 秒片,按 15 秒计费。素材越短越省。
规格
- 输入
- 文字描述(必填);三种起手方式任选其一:仅文字、首帧图片(可再加一张尾帧)、或参考素材(最多 9 张参考图、3 段参考视频、3 段参考音频,参考视频总时长 15 秒以内)。图片单张 20MB 以内,支持 PNG / JPG / WebP 以及 HEIC(在浏览器中转换后上传)。
- 时长
- 5~15 秒,任意整数,提交前选择。
- 输出规格
- 768P / 2K,24 帧/秒,带立体声音轨。
- 费率
- 768P 0.75 积分/秒,2K 1.56 积分/秒。参考视频的时长按输出同价并入计费秒数;参考图前 5 张免费、超出每张 1 积分;参考音频不额外计费。
- 失败退款
- 因系统错误导致的生成失败,消耗的积分自动退回。
负责任地使用
请遵守《服务条款》和《可接受使用政策》使用 JIUFENG。不符合适用规则的请求可能被拒绝。