从「路人甲提示词」到「出片大导」的 6 关闯关 · 学 MiniMax H3 怎么用
👇 向上滑 / 点「下一关」开始冒险
H3 把"生成视频"拆成几种「拍摄场景」。先选对类型,提示词写法才跟着对。选错类型,模型一脸懵。
示范场景:「我有产品定妆图一张,想让它转一圈展示 logo」
先自己判断:给了什么素材、要它怎么动 → 该用哪种?
轮到你写个真实想做的片,先填空:
__________(场景) → 用 ______(T2VA / I2VA / FL2VA / L2VA)
假装朋友完全不懂 AI,说清:H3 有几种"拍法"、区别在哪。
H3 的提示词质量直接决定出片。它把视频控制拆成 六层:先解决"不能变"和"发生什么",再补画面和声音。只写"高级、电影感、炸裂"=没有可执行镜头。
【目的】一条 ___ 的短片,结尾落在 ___。 【不变量】人物:脸/发型/外套/配色不变;产品:___ 形状与 ___ 字样不变。 【事件】___ 先 ___,接着 ___,最后 ___(单镜头别拆段)。 【摄影】机位:___(推进/环绕/手持);景别:___(中景→特写)。 【质感】光线:___;色调:___;材质:___。 【声音】对白:___;环境声:___;配乐:___(不需要就写"无音乐")。
用自己话解释:为什么"电影感"三个字没用,而"伦勃朗光+中景推进"有用?
"一个女孩在跑"和"一个女孩在雨中疾跑、镜头手持跟拍"差的是动作描写。H3 不会自动把"走"理解成"匆忙"还是"闲庭信步"——差别全在提示词。五个元素按影响力排序:
[机位] 缓慢 dolly push 向人物,机位稳定于胸平。 [主体] 女子转身,节奏从容,肩放松,目光落向手中书。 [时间] 起:背对镜头 → 承:侧身迈步 → 合:近侧脸翻开书。 [速度] 舒缓、有重量,无突然加速。 [力] 外套随转身自然垂坠微摆,发丝随身体微动。
进阶:短于 6 秒只写 2 个时间节拍;长片可写 3 个。
为什么"一个男人走路"不够,要写"步伐从容、手臂轻摆、湿地面 deliberate 脚步"?
H3 是 音视频联合生成。不写声音方向,音频部分可能变成"奇怪的语音杂音"。声音要当时间线来写,分三层:
[声音·前景] 书页翻动声、轻吸一口气。 [声音·环境] 咖啡馆底噪、远处勺碰杯。 [声音·配乐] 轻柔钢琴,能量偏低,铺在对话之下。 [空间] 对白居中;环境声两侧;无突兀转场音。
为什么"加真实音效"这四个字不够,要列三层并卡准动作?
当你手上有 多份素材(图≤9、视频≤3、音频≤3),用全参考模式。它用六段式结构,并强制你给每份素材"派活"——哪份定身份、哪份只供姿势/光线,冲突以谁为准。
【主体定义】机器人角色,银色外壳、比例精确(取自图1)。 【视频概要】机器人在日式车厢内行走并望向窗外的连续镜头。 【保留分析】保留:机器人外形/材质;替换:环境为明亮列车车厢。 【详细描述】起:车厢门口 → 承:稳步走向窗边 → 合:驻足望窗外。 【声音景观】车厢轻晃声、远处报站、无对白。 【非剧情乐】温暖弦乐,能量中低。 [素材绑定] 图1=身份与材质;图2=车厢光线风格;视频1=步态节奏。
为什么多素材时"必须给每份素材派活",而不是丢进去让模型自己懂?
前面五关都过了?来真刀真枪。下面用官方 goodcase(便携榨汁机产品演示)做对照:菜鸟版 vs 导演版。
⚠️ 先自己照着前五关写一版"导演版"榨汁机提示词,写完再展开下面对照,别一上来抄。
「一个好看的榨汁机在厨房,做出好喝的果汁,很高级,电影感。」
❌ 零不变量→形状乱变
❌ 无机位→镜头乱飘
❌ 无声音→杂音
❌ "高级/电影感"不可执行
「一双手在明亮厨房台面演示便携榨汁机。单镜头连续三动作:加水果→锁盖→启动搅拌。机位从俯拍平滑降至眼平,结束定格成品饮。保留参考图的器具形状/按键布局/品牌字。自然日光、清爽商业色。立体声:果肉落入杯、清脆锁盖声、马达渐起、最后落杯。logo 清晰。无多人手、无切镜、无音乐,15 秒。」
✅ 不变量锁死
✅ 单镜头时间线
✅ 机位明确
✅ 声音三层+卡点
✅ 约束放最后
用 1 分钟,给完全不懂的人讲清:怎么用 H3 写出一条"出片稳"的提示词。讲完就毕业。
双子座记不住文字,但记得住自己拍出来的片子。每过一关,去 H3 生成一条,把链接/录屏存这里,复习就放片子看。
提示:不想自己拍,也能用 WorkBuddy 内置「视频生成」做动态示意循环,但你自己的 H3 出片才是这关真正的记忆锚。
别"系统学完再练"。每天只挑 1 关,写 1 条提示词 → 出 1 片 → 用自己话讲 1 遍。六天走完一轮,比一次看三小时记得牢。
复习不看文档,看「视频记忆舱」里的片子 + 哼一遍对应 RAP。双子座的脑子,旋律比段落好使。