按创作目标选择 H3 工作流
开场构图重要时使用图生视频,需要控制最终构图时再添加可选尾帧;身份、动作或声音需要跨素材传递时使用参考生视频,并按交付需求直接选择 768P 或 2K。
使用文本、必需首帧与可选尾帧或多模态参考,生成 4–15 秒带原生立体声的 MiniMax H3 视频。
选择生成模式,添加必需素材,写下导演指令,然后生成 MiniMax H3 视频。
MiniMax H3 将文本、图像、视频和音频上下文组织成带原生立体声的连贯 AI 视频。你可以设计 4–15 秒镜头,指定首帧与尾帧,组合多模态参考,选择交付画幅,并让同一个音画创意从提示词贯穿到完整片段。
用一份多模态创意简报统一画面连续性、表演、对白、环境声与音乐

MiniMax H3 是一套全模态视频生成系统,能够理解文本、图像、视频和音频,并输出带原生立体声的视频。文生视频用于提示词驱动镜头;图生视频使用必需首帧和可选尾帧;参考生视频则面向更大的多模态参考组合。
对创作者而言,关键变化是把音画放进同一份创意简报。人物身份、镜头构图、参考动作、对白、环境声和音乐方向不再是互相割裂的任务,而是同一个 4–15 秒片段里的协同要素。
开场构图重要时使用图生视频,需要控制最终构图时再添加可选尾帧;身份、动作或声音需要跨素材传递时使用参考生视频,并按交付需求直接选择 768P 或 2K。
横屏、方形和竖屏画幅覆盖电影镜头、产品页、信息流和短视频。输出为 24 fps 画面与原生 32 kHz 立体声音频,可继续进入剪辑时间线。
价值不只来自某一个参数,而在于时长、首尾帧、参考素材、画幅、声音与语言控制如何共同服务一份制作方案。
根据短视频钩子、产品揭晓、对白段落、表演节拍或转场镜头选择 4 到 15 秒时长,不必把每个创意硬塞进固定长度。
参考生视频在规定时长和文件限制内可使用最多九张图、三个视频与三段音频,混合文件总数最高为十二个。
图生视频使用必需首帧与可选尾帧,为镜头固定视觉起点,并在需要时明确最终构图。
支持 21:9、16:9、4:3、1:1、3:4 与 9:16 等横屏、方形和竖屏构图,从一开始就按最终发布媒介设计镜头。
对白、环境声、音效与音乐可随画面生成 32 kHz 立体声音频。提示词应说明每种声音何时出现、处于什么空间,并如何配合可见动作。
十一种稳定对白语言覆盖阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
好的 MiniMax H3 简报会给每份输入明确职责:静态图锁定身份和设计,视频示范运动,音频控制表演和节奏,提示词负责把它们串成时间线。

用产品图保持轮廓与材质,以短视频参考引导揭晓动作,再用定时音效强化触感细节和最终品牌节拍。

通过图片锁定面孔、服装与环境,写明台词和空间底噪,再导演视线、反应节奏、机位距离与结尾画面。

让参考视频控制身体节奏,静态图片定义最终人物与造型,再补充音乐方向、竖屏构图和适合平台阅读的收尾定格。
先确定交付格式,再选择正确的 H3 输入方式,为每个参考分配单一职责,并在同一时间线上导演画面和声音。
先选择 4–15 秒和真实发布画幅,明确开场动作、转折点,以及最后一秒观众应该看到和听到什么。
构图主导的镜头使用文本或首尾帧;需要从源素材继承身份、示范动作、说话方式或声音方向时,使用多模态参考。
标明哪张图控制身份、哪张图控制环境、哪个视频只控制动作、哪段音频控制人声或节奏,并删除互相冲突的素材。
依次检查身份、接触物理、镜头动机、口型时序、对白清晰度、环境声、音乐平衡和结尾帧,再下载 768P 或 2K 结果进入后期剪辑。
H3 将 MiniMax 视频工作流从常规文生和图生视频,扩展到全模态参考与原生音画联合输出。
| 工作流 | MiniMax H3 | 海螺 2.3 | 创作影响 |
|---|---|---|---|
| 视频时长 | 4–15 秒 | 按配置为 6 秒或 10 秒 | H3 为短叙事与商业镜头提供更宽的时长选择。 |
| 输入结构 | 文本、首尾帧、图像、视频与音频参考 | 文生视频与图生视频 | H3 可通过不同输入分别表达身份、动作、表演和声音。 |
| 音频输出 | 原生 32 kHz 立体声音频 | 视频生成工作流 | H3 能把画面与声音作为一个生成片段共同导演和验收。 |
| 分辨率路径 | 直接生成 768P 或 2K | 768p 或 1080p 配置 | 在 MiniMax H3 生成请求中直接选择所需输出分辨率。 |
按输入需求和交付目标选择:H3 适合多模态音画联合导演;海螺 2.3 适合成熟的文生视频和图生视频配置。
有效提示词需要说明可见事件、参考素材职责、镜头行为、对白表演、环境声、音效、音乐和最终画面。
在风格词之前写明时长、画幅、平台、受众和镜头用途。
明确哪张图控制身份、哪个视频控制动作、哪段音频控制人声或节奏。
把 4–15 秒拆成开场、发展和收尾定格,并为每段指定可观察动作。
写清景别、镜头质感、运动、速度,以及这次运动要揭示什么。
拆分对白、空间底噪、音效与音乐,为每一层指定进入时间、强度和画面关系。
列出不能漂移的人物身份、产品几何、服装、光线方向、文字与结尾帧细节。
每条指令都能在画面或声音中验收,修改时更容易精准定位。
交付规格 12 秒 16:9 高级产品短片,生成原生立体声音频。 参考职责 @图片1 控制瓶身几何与正面标签安全区域。@视频1 只控制手部缓慢动作。@音频1 只控制说话语气,不复制原句。 时间线 0–4 秒——85mm 微距横移,掠过瓶身冷凝水;轻微空间底噪与一次玻璃细节音。 4–9 秒——镜头拉远,一只手将瓶身旋转 30 度;平静人声说:‘让清晰,保持流动。’ 9–12 秒——锁定英雄镜头,琥珀色轮廓光,音乐短暂收束,保留一秒干净定格。 不变量 保持瓶身比例、瓶盖高度、标签区域、镜头轴线与光线方向不变。不要字幕、额外物体或无关音乐。
当短视频需要稳定身份、示范动作、可听见的表演,或明确的首帧到尾帧发展时,H3 的多模态工作流最有价值。
在一个 4–15 秒素材中完成钩子、演示、口播、触感音效和最终产品画面。
通过产品参考保持外形和材质,在微距细节、手持动作、情境展示与收尾定格之间保持一致。
在同一音画片段中协调人物身份、视线、反应节奏、台词、口型、环境声和机位距离。
直接以 9:16 构图,用视频参考引导表演,并以适合手机阅读的清晰画面收尾。
利用音频参考与音乐方向,让动作重音、镜头节奏、氛围和最终节拍保持一致。
使用支持的对白语言,同时保持产品、人物、视觉结构与营销节奏不变。
了解 MiniMax H3 的时长、多模态参考、原生立体声音频、画幅、768P 与 2K 输出、提示词及海螺 2.3 对比。
设置时长、必需首帧与可选尾帧、参考职责、镜头运动、对白、环境声和音乐,然后在 MiniMax H3 工作台直接生成。
