🎬 H3 冒险岛
0 / 6 关

🗺️ 冒险地图 · 点岛跳关

🏝️1·选片种 📐2·六层 🎥3·运镜 🎧4·声音 🧬5·全参考 🏆6·擂台

🎬 H3 导演冒险岛

从「路人甲提示词」到「出片大导」的 6 关闯关 · 学 MiniMax H3 怎么用

⚔️ 闯关🗺️ 冒险 🥊 PK🎤 费曼❓ 苏格拉底
给坐不住的双子座:每关一屏,看完就动手,别想"先系统学完"。
学完必须讲:每关结尾用自己话讲一遍(费曼),不讲等于没学。
追问逼思考:苏格拉底三问点开看,别直接抄答案。

👇 向上滑 / 点「下一关」开始冒险

🏝️

第一关 · 认清你要拍哪种片

任务类型

H3 把"生成视频"拆成几种「拍摄场景」。先选对类型,提示词写法才跟着对。选错类型,模型一脸懵。

🎬T2VA 文生视频零参考图从零编剧创意发散 🖼️I2VA 图生视频1张首帧接着图拍产品/角色 🔁FL2VA 首尾帧2张图编中间动作变换 🎯L2VA 尾帧生1张尾图反推前情悬念揭晓
🎵 记忆RAP:
「没有图就 T2VA,一张首图 I2VA;
头尾都给 FL2VA,只剩结尾 L2VA;
选错类型别怪它,导演先得定玩法。」
★ 口诀:给几张图、给的是头还是尾,决定用哪一关写法。

⚔️ 实操任务

示范场景:「我有产品定妆图一张,想让它转一圈展示 logo」
先自己判断:给了什么素材、要它怎么动 → 该用哪种?
轮到你写个真实想做的片,先填空:
__________(场景) → 用 ______(T2VA / I2VA / FL2VA / L2VA)

💡 示范参考答案(想好再点开)
→ I2VA。理由:给了定妆图=首帧参考图,要它在图上"转一圈展示"=以图延展生成,属图生视频 I2VA,不是凭空 T2VA。

🎤 费曼关:用三句话讲给朋友

假装朋友完全不懂 AI,说清:H3 有几种"拍法"、区别在哪。

❓ 苏格拉底三问(点开看引导,先自己想)

Q1:只有一张"成品图",想倒推它怎么发生,用哪种?
→ 尾帧 L2VA。结尾图已知,反推前情让它自然落到这张图。
Q2:T2VA 自由度最高,为什么反而最容易"跑偏"?
→ 零参考,模型自己定场景/选角/镜头,约束越少越飘。适合发散,不适合"要稳"。
Q3:FL2VA 给了头尾两张图,中间谁决定?
→ 你。模型只保头尾一致,中间过渡(转身、开伞)要你写清楚。
📐

第二关 · 提示词不是散文,是控制文档

六层框架

H3 的提示词质量直接决定出片。它把视频控制拆成 六层:先解决"不能变"和"发生什么",再补画面和声音。只写"高级、电影感、炸裂"=没有可执行镜头。

① 目的 · 这条视频为什么存在 ② 不变量 · 什么绝不能漂移 ③ 事件 · 画面里实际发生什么 ④ 摄影 · 观众怎么看见它 ⑤ 质感 · 它属于什么世界 ⑥ 声音 · 观众怎么听见它
🎵 记忆RAP(六层顺序别乱):
「目的先讲为啥拍,不变量别乱改;
事件写清谁在动,摄影机位安排;
质感定下光与色,声音三层别空白。
前三层是地基,后三层才出彩。」
★ 不变量=脸/服装/产品形状/品牌字;事件=动作顺序/状态变化;先写这俩,模型才不飘。摄影=从哪看+离多近(机位/景别);质感=它像什么世界的片(光与色调)。

⚔️ 实操任务 · 抄这个填空模板去生成

【目的】一条 ___ 的短片,结尾落在 ___。
【不变量】人物:脸/发型/外套/配色不变;产品:___ 形状与 ___ 字样不变。
【事件】___ 先 ___,接着 ___,最后 ___(单镜头别拆段)。
【摄影】机位:___(推进/环绕/手持);景别:___(中景→特写)。
【质感】光线:___;色调:___;材质:___。
【声音】对白:___;环境声:___;配乐:___(不需要就写"无音乐")。

🎤 费曼关

用自己话解释:为什么"电影感"三个字没用,而"伦勃朗光+中景推进"有用?

❓ 苏格拉底三问

Q1:为什么"不变量"要放在"事件"前面写?
→ 先锁死不能漂的东西(脸/产品),动作才不会把主体搞变形。地基不稳,戏再好也崩。
Q2:如果只写"高级感",模型会怎么处理?
→ 它没法把形容词翻译成镜头,只能自由发挥,结果不可控。要写可观察特征(光/色/机位)。
Q3:六层里哪层最易被漏、却最影响观感?
→ 声音。H3 音视频联合生成,不写声音方向,音频可能变奇怪杂音。
🎥

第三关 · 让动作可控的运镜五元素

Motion

"一个女孩在跑"和"一个女孩在雨中疾跑、镜头手持跟拍"差的是动作描写。H3 不会自动把"走"理解成"匆忙"还是"闲庭信步"——差别全在提示词。五个元素按影响力排序:

1 机位怎么拍 2 主体怎么动 3 时间怎么展开 4 速度什么情绪 5 力物理感
🤷 零基础翻译(看不懂黑话先看这):
· 机位=观众站在哪看你(推进=凑近、环绕=绕着转、手持=像人拿着晃);
· 主体=画面里谁、在做什么动作;
· 时间=这一镜的节奏分段:起(开头)→承(发展)→合(收尾);
· 速度=动作快还是慢,带什么情绪;
· =东西怎么受物理影响而动(布料甩、水波纹、头发飘)。
★ Dolly/Steadicam 那些英文是进阶写法,先用中文也出片,别被吓退。
🎵 记忆RAP:
「机位先说怎么拍,主体动作写明白;
时间分作起承合,速度带出喜与哀;
重力风力布料甩,物理真实才不歪。」
★ 专业词直接上:Dolly push(推进)、Steadicam(斯坦尼康)、Whip pan(甩镜)、Rack focus(移焦)、Orbital(环绕)。

⚔️ 实操任务 · 运镜五元素模板

[机位] 缓慢 dolly push 向人物,机位稳定于胸平。
[主体] 女子转身,节奏从容,肩放松,目光落向手中书。
[时间] 起:背对镜头 → 承:侧身迈步 → 合:近侧脸翻开书。
[速度] 舒缓、有重量,无突然加速。
[力] 外套随转身自然垂坠微摆,发丝随身体微动。

进阶:短于 6 秒只写 2 个时间节拍;长片可写 3 个。

🎤 费曼关

为什么"一个男人走路"不够,要写"步伐从容、手臂轻摆、湿地面 deliberate 脚步"?

❓ 苏格拉底三问

Q1:五个元素里,哪两个"起步必须写"?
→ ① 机位 + ② 主体动作。其余在你觉得默认出片不对味时再加。
Q2:一镜头塞无人机+微距+手持+环绕,反而容易翻车?
→ 几秒内塞太多运镜,模型不知主路径。先选一条主路径,再加构图和速度。
Q3:"突然 sharp 一甩,再落入缓慢 ripple" 用了哪几个元素?
→ 速度(sharp→languid)+ 力(布料/水受物理影响),时间上"起急→合缓"。
🎧

第四关 · 声音三层,别留白

Audio

H3 是 音视频联合生成。不写声音方向,音频部分可能变成"奇怪的语音杂音"。声音要当时间线来写,分三层:

🗣️前景声对白/按键/脚步/引擎 🌧️环境声雨/房间底噪/风/厨房 🎵配乐风格/能量/是否铺底
🎵 记忆RAP:
「前景人声先说清,环境铺底像真人;
配乐风格能量定,卡点要对准动作;
三层写全才立体,留白变成杂噪音。」
★ 空间感也给一句:对白居中、雨声铺两侧、厨房声在后方。不需要音乐就写"无音乐",删层反而更 intentional。前景声=主角发出的声音;环境声=现场底噪;配乐=背景音乐;卡点=音效要跟画面动作同一瞬间发生。

⚔️ 实操任务 · 把声音接进你的提示词

[声音·前景] 书页翻动声、轻吸一口气。
[声音·环境] 咖啡馆底噪、远处勺碰杯。
[声音·配乐] 轻柔钢琴,能量偏低,铺在对话之下。
[空间] 对白居中;环境声两侧;无突兀转场音。

🎤 费曼关

为什么"加真实音效"这四个字不够,要列三层并卡准动作?

❓ 苏格拉底三问

Q1:三层里哪层"没有就最假"?
→ 环境声。纯对白+音乐像棚录,加了房间底噪才像"真在现场"。
Q2:什么时候反而要"删掉"一层?
→ 短片极简时删配乐,反而更 intentional。别无脑堆满三层。
Q3:卡点是什么意思?
→ 关键音效(盖子咔哒、马达启动)要和画面可见动作精确对齐,否则脱节出戏。
🧬

第五关 · 全参考模式 Ref2VA 六段式

Ref2VA

当你手上有 多份素材(图≤9、视频≤3、音频≤3),用全参考模式。它用六段式结构,并强制你给每份素材"派活"——哪份定身份、哪份只供姿势/光线,冲突以谁为准。

主体定义 视频概要讲啥 保留分析保啥 详细描述时间线 声音景观听啥 非剧情乐配乐
🎵 记忆RAP:
「素材多就全参考,六段按序别跳号;
人人图里派好活,谁定身份谁配角;
冲突以谁为准绳,莫让模型瞎猜套。」
★ 必写一句绑定:「图1负责人物身份与服装;图2只负责产品外形;视频1负责动作与机位」。冲突要明确优先级。

⚔️ 实操任务 · Ref2VA 六段式模板

【主体定义】机器人角色,银色外壳、比例精确(取自图1)。
【视频概要】机器人在日式车厢内行走并望向窗外的连续镜头。
【保留分析】保留:机器人外形/材质;替换:环境为明亮列车车厢。
【详细描述】起:车厢门口 → 承:稳步走向窗边 → 合:驻足望窗外。
【声音景观】车厢轻晃声、远处报站、无对白。
【非剧情乐】温暖弦乐,能量中低。
[素材绑定] 图1=身份与材质;图2=车厢光线风格;视频1=步态节奏。

🎤 费曼关

为什么多素材时"必须给每份素材派活",而不是丢进去让模型自己懂?

❓ 苏格拉底三问

Q1:Ref2VA 和普通 I2VA 最大区别?
→ 素材数量与结构。I2VA 一张首帧接着拍;Ref2VA 多图多视频多音频,需六段式编排+绑定。
Q2:"图1参考人物"和"视频1保持原人物"同时写却不说明优先级,会怎样?
→ 模型不知听谁的,可能把视频里人脸覆盖到图1身份上,主体漂移。
Q3:保留分析(retention)写什么?
→ 哪些特征必须跨帧一致:人脸、产品几何、品牌字、房间布局、说话人身份。
🏆

第六关 · PK 大擂台 + 毕业考

实战

前面五关都过了?来真刀真枪。下面用官方 goodcase(便携榨汁机产品演示)做对照:菜鸟版 vs 导演版

⚠️ 先自己照着前五关写一版"导演版"榨汁机提示词,写完再展开下面对照,别一上来抄。

🥊 PK:同一条"榨汁机演示",两种写法

😵 菜鸟版(别学)

「一个好看的榨汁机在厨房,做出好喝的果汁,很高级,电影感。」

❌ 零不变量→形状乱变
❌ 无机位→镜头乱飘
❌ 无声音→杂音
❌ "高级/电影感"不可执行

😎 导演版(学这个)

「一双手在明亮厨房台面演示便携榨汁机。单镜头连续三动作:加水果→锁盖→启动搅拌。机位从俯拍平滑降至眼平,结束定格成品饮。保留参考图的器具形状/按键布局/品牌字。自然日光、清爽商业色。立体声:果肉落入杯、清脆锁盖声、马达渐起、最后落杯。logo 清晰。无多人手、无切镜、无音乐,15 秒。」

✅ 不变量锁死
✅ 单镜头时间线
✅ 机位明确
✅ 声音三层+卡点
✅ 约束放最后

🎵 毕业RAP:
「菜鸟写形容词,导演写控制句;
不变量先锁死,时间线排起承合;
机位声音都写全,约束压轴别啰嗦。
六关走完你出片,双子座也能 hold 住!」

🎤 毕业费曼考(录语音/写下来都行)

用 1 分钟,给完全不懂的人讲清:怎么用 H3 写出一条"出片稳"的提示词。讲完就毕业。

❓ 毕业追问(想清楚再关页)

Q1:你刚写的提示词,哪一层最容易再翻车?下次怎么防?
→ 多半是"不变量"或"声音"。防法:生成前先默写六层,缺一层补一层。
Q2:如果出片人物脸变了,先改哪句?
→ 先补"不变量:人脸/发型保持不变",并把参考图角色优先级写明白。
Q3:提示词越长越好吗?
→ 不。社区统计官方示例中位约 130 中文字。关键是结构完整、描述精准,不是堆字。

🚀 通关后怎么练(给坐不住的你)

别"系统学完再练"。每天只挑 1 关,写 1 条提示词 → 出 1 片 → 用自己话讲 1 遍。六天走完一轮,比一次看三小时记得牢。

复习不看文档,看「视频记忆舱」里的片子 + 哼一遍对应 RAP。双子座的脑子,旋律比段落好使。

已复制 ✓