Mminimax

MiniMax H3

MiniMax H3 是 MiniMax 的通用多模态生成模型。在 JIUFENG 工作台中,它接受文字描述、首帧图片,或参考图、参考视频与参考音频,输出 768P / 2K、24 帧/秒、带立体声的视频,按秒计费。

文字描述
首帧与尾帧
参考素材
档位与时长
768P0.75 积分/秒
2K1.56 积分/秒
提交前请选择时长,按秒计费。

模型概览

MiniMax H3 是 MiniMax 发布的通用多模态生成模型,官方定位是在文字、图像、视频与音频之间统一理解上下文,并据此生成画面与声音。JIUFENG 工作台接入了它的视频生成能力,三种起手方式:仅凭文字描述生成;以一张图确定首帧、画面自该帧继续(可再给一张尾帧);或提供参考图、参考视频与参考音频,让模型参照其中的主体、动作与声音。生成在服务端完成,成片进入你的作品记录。

三种起手方式对应不同的控制程度。只给文字时,构图与运动都由模型决定;给定首帧时,画面内容由这一帧确定,模型只生成其后的运动;参考素材则介于两者之间,用已有素材约束主体与风格,而不锁死每一帧。音轨与画面一次生成,无需另行配音。工作台与 API 的能力面一致,只有默认值不同:经 API 调用时不传 resolution 默认为 2K,工作台默认 768P。

工作台选项

文字描述

描述画面的主体、动作与环境。任何一种起手方式都需要它。

首帧与尾帧

以一张图确定视频的第一帧,画面自该帧继续;可再给一张尾帧。

参考素材

参考图、参考视频与参考音频,让模型参照其中的主体、动作与声音。与首/尾帧不能同时使用。

档位与时长

提交前选择输出规格与时长,两者共同决定本次消耗。

官方声明的强项

指令遵循

官方将指令遵循列为该模型的强项之一。适用于对主体、动作与镜头有明确要求的描述。

画面与声音同时生成

音轨随画面一次生成,环境声与画面动作对应,不需要额外的配音步骤。

文字与品牌标识

官方另将文字与品牌标识的准确呈现列为强项。适用于带字幕、招牌或包装的镜头。

商业内容创作

官方称其面向广告、品牌、电商与产品设计等商业内容创作场景。

示例

下面每条都对应上面提到的一项能力,点开可以直接看效果(含声音)。

指令遵循:描述里给了机位、运动方式与停点,看它是否照做
画面中的文字:杯身贴纸上的字是否清晰成形(竖幅)
原生声音:音轨与画面一次生成,雨声与画面动作对应
商业镜头:玻璃、金属与液体的材质表现,产品广告的布光
材质与光影:缎面反光、侧逆光下的轮廓
图生视频:首帧用的是本站示例图,只让画面动起来、不改构图
非写实风格:水彩笔触与水痕,不是照片质感
大景别:云层翻涌与光线扫过——静态图给不了的部分

如何生成视频

  1. 打开已选中该模型的创作空间,描述主体、动作和镜头运动,再选择纯文字、首尾帧或参考素材作为输入。
  2. 选择输出尺寸和时长。首尾帧与参考素材是两种不同模式,按当前选择核对预估积分。
  3. 登录后提交视频生成。完成后播放并检查画面和声音,再调整提示词或输入素材进行下一次尝试。

使用建议

  1. 输出规格与时长共同决定本次消耗,两者都在提交前选择。验证方向时用较低档位与最短时长。
  2. 描述中写明运动方式(镜头推进、人物转身、水面起伏),而不只描述静态的画面内容。
  3. 需要精确控制画面内容时,先生成一张静帧图片,再以该图作为首帧。
  4. 参考视频的时长会按输出同价并入计费秒数:传一段 10 秒素材出一条 5 秒片,按 15 秒计费。素材越短越省。

规格

输入
文字描述(必填);三种起手方式任选其一:仅文字、首帧图片(可再加一张尾帧)、或参考素材(最多 9 张参考图、3 段参考视频、3 段参考音频,参考视频总时长 15 秒以内)。图片单张 20MB 以内,支持 PNG / JPG / WebP 以及 HEIC(在浏览器中转换后上传)。
时长
5~15 秒,任意整数,提交前选择。
输出规格
768P / 2K,24 帧/秒,带立体声音轨。
费率
768P 0.75 积分/秒,2K 1.56 积分/秒。参考视频的时长按输出同价并入计费秒数;参考图前 5 张免费、超出每张 1 积分;参考音频不额外计费。
失败退款
因系统错误导致的生成失败,消耗的积分自动退回。

负责任地使用

请遵守《服务条款》和《可接受使用政策》使用 JIUFENG。不符合适用规则的请求可能被拒绝。