2026-09-08 · 各場用哪一種模型

生成

先用 H3

鏡頭表上的每一條,先用 MiniMax H3-Base。模型卡寫單次 4–15 秒。Diffusers 常見 5–15 秒。較短邊 768 像素。畫面與 32 千赫立體聲同一檔。一次請求只用 FL2VARef2VA 其中一組。

畫面不對,先改第一幀或首尾幀怎麼給。還是不對,再換開源模型。H3 沒有官方的姿勢影片介面。姿勢影片是 Wan 的備援。

一條約會咖啡店畫面,標 4–15 秒、較短邊 768 像素、每秒 24 格、32 千赫立體聲。
H3 單次:數秒、較短邊 768 像素、每秒 24 格、立體聲同檔。

起、承、合

約會、老式公寓走廊與家門、早晨兩杯,先用 H3。沒有參考圖時,用純文字,並寫鏡頭編號 [Shot n]。要對上臉、服裝或房間時,用 Ref2VA。脫衣與交合不要寫進這三場。

  • 預設:H3-Base,FL2VARef2VA
  • 備援:Wan 2.1 或 2.2 從文字或圖片生成。HunyuanVideo-1.5 從圖片生成。LTX-2 從文字、圖片或關鍵幀生成。
左欄 FL2VA 給首尾幀;右欄 Ref2VA 用參考圖。
H3 兩種請求:左邊 FL2VA,右邊 Ref2VA

轉 · 交合

四種鏡頭,做法不同。性器近景先備好第一張完整畫面,不要只靠文字。

  • 脫衣或靠近床:先試 H3。
  • 交合主鏡:先試 H3。不對,見下面。
  • 性器近景:先備好第一張完整畫面。預設本機 H3。
  • 停頓:先試 H3。接到合。
四格:床邊靠近、被子蓋到肩的主鏡、手抓床單的近景、靠在肩上的停頓。
轉的四格:靠近床、被子下主鏡、近景另備第一張、停頓。約 2020,老式公寓。

先試 H3

先有這條鏡頭的第一張完整畫面。起承合不走這一段。

  1. 提供 第一張完整畫面。主鏡是全身姿勢已成立。近景另備一整張,不裁主鏡。並寫這幾秒怎麼動。
  2. 基本 本機 H3-Base。FL2VA 只給第一幀(官方也叫 I2VA),或給首尾兩幀。一次數秒。
  3. 判斷 能用就選片。不對先改方法,再換權重。

畫面不對,只換方法,第一張不變。

  • 官方模型加 LoRA 姿勢、節奏或局部樣子。
  • 微調過的模型 檔本身偏向成人畫面。第一張完整畫面仍要。
  • Wan、LTX 或社群改過的權重 不保證結構正確。Wan 的 LoRA 常要 HIGH/LOW 成對。
  • 動作先成立再換臉 只換身份,不修正身體結構。
上排:取景器裡的第一幀、H3 播放器出數秒、選片。下排:LoRA 加動作箭頭、微調檔取代底模、Wan 的 HIGH/LOW、換臉偵測框。
上排先試 H3。下排只改方法:疊 LoRA、換微調檔、換 Wan/LTX、只換臉。

一、先備好近景的第一張完整畫面

先備好一張完整的近景,或先做立體模型。再把這整張當第一幀,生成數秒。不是把性器單獨裁出來貼在身體上。每一條先試 H3 的 FL2VA 只給第一幀,或給開頭與結尾兩幀。官方也把只給第一幀叫做 I2VA,不是第三組模型檔。

  • H3 還是不對:Wan 從圖片生成影片。Wan 2.1 可給首尾兩幀(FLF2V)。
  • 需要跟著已有的動作走:改用 Wan 的 VACE,或 Wan-Animate(參考圖加上姿勢影片)。
  • 需要中間落在指定姿勢:LTX-2 用關鍵幀生成中間動作。
  • HunyuanVideo-1.5 可以從圖片生成影片。
左:床單已動,鮑魚貼片停在原地。右:鮑魚、黃瓜與床單整張一起動。
左是貼上去的不變圖塊。右是整張當第一幀再動。替代物在床單近景裡,示意開口與軸線。

二、社群改過的權重

多半掛在 Wan、LTX 或別人改過的檔上。不保證結構正確。仍先備好近景的第一張完整畫面,再生成動作。

三、動作先成立再換臉

交合動作先成立,身份後換。畫面可以是生成的、立體模型,或已有的成年虛構素材。換臉只換臉,不修正身體結構。

接上下一條

  • 把上一條 H3 的最後一幀,當作下一條 FL2VA 只給第一幀時的第一幀。
  • 開頭與結尾兩格都給時,對齊開頭 0.00 與結尾秒數。
  • Wan 的 VACE 官方建議一次約 5 秒,並用 firstclip 把上一條接下去。
左:老式公寓樓梯尾幀;右:下一條首幀,鑰匙停在舊鎖上。
上一條最後一幀,當作下一條第一幀。

身份

生成時用 Ref2VA 看參考圖。換臉是生成以後找出臉再置換。起承合若只要像同一張臉,參考圖通常就夠。轉若先做動作再換臉,換臉只處理身份。

左欄參考圖直接生成約會裡的兩人;右欄生成以後才換臉。
左:生成時看參考圖。右:生成後才換臉。

詞彙

FL2VA

H3 的一組模型檔。純文字、只給第一幀、只給最後一幀,或兩格都給。只給第一幀時,官方也叫 I2VA。Wan 2.1 把首尾兩幀叫做 FLF2V

Ref2VA

H3 的另一組模型檔。生成時看參考圖、參考影片、聲音。不是換臉。

VACE

Wan 的參考與姿勢控制。官方建議一次約 5 秒,並用 firstclip 接上一條。

換臉

生成以後找出臉,換成另一張。不修正身體結構。