2026-09-08 · 各場用哪一種模型
生成
先用 H3
鏡頭表上的每一條,先用 MiniMax H3-Base。模型卡寫單次 4–15 秒。Diffusers 常見 5–15
秒。較短邊 768 像素。畫面與 32 千赫立體聲同一檔。一次請求只用
FL2VA 或 Ref2VA 其中一組。
畫面不對,先改第一幀或首尾幀怎麼給。還是不對,再換開源模型。H3 沒有官方的姿勢影片介面。姿勢影片是 Wan 的備援。
起、承、合
約會、老式公寓走廊與家門、早晨兩杯,先用 H3。沒有參考圖時,用純文字,並寫鏡頭編號
[Shot n]。要對上臉、服裝或房間時,用 Ref2VA。脫衣與交合不要寫進這三場。
- 預設:H3-Base,
FL2VA或Ref2VA。 - 備援:Wan 2.1 或 2.2 從文字或圖片生成。HunyuanVideo-1.5 從圖片生成。LTX-2 從文字、圖片或關鍵幀生成。
FL2VA,右邊 Ref2VA。轉 · 交合
四種鏡頭,做法不同。性器近景先備好第一張完整畫面,不要只靠文字。
- 脫衣或靠近床:先試 H3。
- 交合主鏡:先試 H3。不對,見下面。
- 性器近景:先備好第一張完整畫面。預設本機 H3。
- 停頓:先試 H3。接到合。
先試 H3
先有這條鏡頭的第一張完整畫面。起承合不走這一段。
- 提供 第一張完整畫面。主鏡是全身姿勢已成立。近景另備一整張,不裁主鏡。並寫這幾秒怎麼動。
-
基本
本機 H3-Base。
FL2VA只給第一幀(官方也叫I2VA),或給首尾兩幀。一次數秒。 - 判斷 能用就選片。不對先改方法,再換權重。
畫面不對,只換方法,第一張不變。
- 官方模型加 LoRA 姿勢、節奏或局部樣子。
- 微調過的模型 檔本身偏向成人畫面。第一張完整畫面仍要。
- Wan、LTX 或社群改過的權重 不保證結構正確。Wan 的 LoRA 常要 HIGH/LOW 成對。
- 動作先成立再換臉 只換身份,不修正身體結構。
一、先備好近景的第一張完整畫面
先備好一張完整的近景,或先做立體模型。再把這整張當第一幀,生成數秒。不是把性器單獨裁出來貼在身體上。每一條先試 H3 的
FL2VA
只給第一幀,或給開頭與結尾兩幀。官方也把只給第一幀叫做 I2VA,不是第三組模型檔。
- H3 還是不對:Wan 從圖片生成影片。Wan 2.1 可給首尾兩幀(
FLF2V)。 - 需要跟著已有的動作走:改用 Wan 的 VACE,或 Wan-Animate(參考圖加上姿勢影片)。
- 需要中間落在指定姿勢:LTX-2 用關鍵幀生成中間動作。
- HunyuanVideo-1.5 可以從圖片生成影片。
二、社群改過的權重
多半掛在 Wan、LTX 或別人改過的檔上。不保證結構正確。仍先備好近景的第一張完整畫面,再生成動作。
三、動作先成立再換臉
交合動作先成立,身份後換。畫面可以是生成的、立體模型,或已有的成年虛構素材。換臉只換臉,不修正身體結構。
接上下一條
- 把上一條 H3 的最後一幀,當作下一條
FL2VA只給第一幀時的第一幀。 - 開頭與結尾兩格都給時,對齊開頭
0.00與結尾秒數。 - Wan 的 VACE 官方建議一次約 5 秒,並用
firstclip把上一條接下去。
身份
生成時用 Ref2VA 看參考圖。換臉是生成以後找出臉再置換。起承合若只要像同一張臉,參考圖通常就夠。轉若先做動作再換臉,換臉只處理身份。
詞彙
FL2VA
H3 的一組模型檔。純文字、只給第一幀、只給最後一幀,或兩格都給。只給第一幀時,官方也叫
I2VA。Wan 2.1 把首尾兩幀叫做 FLF2V。
Ref2VA
H3 的另一組模型檔。生成時看參考圖、參考影片、聲音。不是換臉。
VACE
Wan 的參考與姿勢控制。官方建議一次約 5 秒,並用
firstclip 接上一條。
換臉
生成以後找出臉,換成另一張。不修正身體結構。