你是不是也有這種經驗:腦中明明有一個很棒的影片企劃,結果光是找素材、剪片段、調字幕就耗掉整個週末,最後成品還不如預期?或者你是接案的小編、自媒體經營者,客戶要一支三十秒的產品短片,你卻要花三天才能交件?
這篇文章要教你一套 2026 年最新的 AI 影片工作流。這不是那種「一鍵生成整支影片」的浮誇教學,而是把 AI 塞進你現有的剪輯流程裡,讓它幫你處理最耗時、最無聊、最重複的那些環節。讀完之後,你應該可以用同樣的時間做出兩到三倍的產出,而且品質不會掉。
我們會用到兩個目前討論度最高的開源模型:負責「動態」的 LTX-2.5,以及負責「靜態畫面與素材」的 Qwen-Image-2.1。這兩個模型都可以在你的工作流程中扮演關鍵角色,而且都有免費或低成本的取得方式。準備好了嗎?我們從最容易被忽略、但影響最大的一步開始。
為什麼你的 AI 影片流程一開始就錯了?
大部分人用 AI 做影片,第一個念頭就是「我要一句話生成一支片」。這在 2026 年技術上做得到,但成品通常有兩個致命問題:第一,畫面邏輯不連貫,觀眾看三秒就出戲;第二,你完全無法控制風格,改一個字整個畫面就重來。
正確的做法,是把 AI 當成「分工很細的助理團隊」,而不是「一個全能的天才」。專業剪輯師的工作流其實是分段的:腳本 → 分鏡 → 素材 → 剪輯 → 配音 → 調色。AI 在每一段都能幫上忙,但你要指定它做哪一段。
舉個具體例子。假設你要做一支「香港茶餐廳文化」的三十秒短片。錯誤做法是直接把「香港茶餐廳文化三十秒短片」丟給影片模型。正確做法是:先用文字模型寫出六個分鏡腳本,再用 Qwen-Image-2.1 生成六張關鍵視覺,接著用 LTX-2.5 把其中三張做成動態鏡頭,最後進剪輯軟體組裝。這樣你對每一個環節都有控制權,出錯也能只改那一小段。
第一步:用 AI 寫出「可拍攝」的分鏡腳本
很多人卡在腳本這關,覺得要自己想。其實你只要給 AI 足夠的框架,它就能產出可用的分鏡。關鍵是給它「時間長度」和「鏡頭數量」這兩個限制。
打開你慣用的對話式 AI,貼上這樣的提示詞:
「請幫我寫一支三十秒的短片分鏡,主題是香港茶餐廳的早晨。請輸出六個鏡頭,每個鏡頭五秒。每個鏡頭要包含:鏡位(遠景/中景/特寫)、畫面描述、以及一句旁白。旁白用廣東話口語,總字數不超過八十個字。」
你會得到一份結構化的分鏡表。這裡有個小技巧:如果 AI 給的鏡頭太抽象(例如「熱鬧的茶餐廳」),你就追問「請把這個鏡頭改成一個具體的動作或物件」。具體的畫面永遠比抽象的描述更容易生成,也更吸引人。
還有一個進階技巧:請 AI 同時給你「英文版的畫面提示詞」。因為目前主流的圖像與影片模型,對英文提示詞的理解還是比較精準。你可以這樣追問:「請把每個鏡頭的畫面描述,改寫成適合 Qwen-Image-2.1 的英文提示詞,風格設定為寫實攝影、自然光、35mm 鏡頭。」
這樣你就一次拿到三樣東西:中文分鏡、旁白稿、以及可以直接餵給模型的英文提示詞。光這一步,就能省下你過去找參考圖、想文案的一兩個小時。
第二步:用 Qwen-Image-2.1 產出關鍵視覺
拿到英文提示詞之後,打開 Qwen-Image-2.1。這個模型目前在 HuggingFace 上週下載量超過九萬次,是 Qwen 系列最新的圖像生成模型,特色是對亞洲場景與人物的還原度特別好,這對香港、台灣的創作者來說是一大優勢。
在生成時,有幾個參數你一定要調:
第一,解析度設為 1280×720 或更高,不要用預設的 512×512,因為影片素材放大後會模糊。第二,把「負面提示詞」填好,建議填入:blurry, distorted faces, extra fingers, watermark, text。第三,如果你要同一個角色出現在多個鏡頭,請在提示詞裡加入固定的角色描述,例如「a middle-aged Hong Kong man wearing a white shirt」,並且使用相同的 seed 值,這樣角色的臉才不會每個鏡頭都變一個人。
生成六張圖大約需要三到五分鐘。這裡的關鍵心法是:不要追求一次到位。先產出第一版,挑出構圖最好的那張,然後用「以圖生圖」的方式微調其他鏡頭,讓整體風格統一。這比重新下六次提示詞快得多。
第三步:用 LTX-2.5 讓靜態畫面動起來
有了六張關鍵視覺,接下來就是讓它們動起來。LTX-2.5 是目前最熱門的開源影片模型之一,一週內在 HuggingFace 上獲得超過六千個讚、下載量突破一百六十萬次,支援圖生影片、文生影片與影片轉影片三種模式。
對我們這種工作流來說,最實用的是「圖生影片」。把剛才 Qwen-Image-2.1 產出的圖片丟進去,加上一段描述動作的提示詞,例如「鏡頭緩慢向前推進,蒸氣從奶茶杯上升起,背景有客人走動」。
這裡有兩個實戰參數要記住:第一,影片長度先設 4 到 5 秒就好,不要貪心設十秒,因為越長越容易出現扭曲。第二,動作幅度(motion strength)建議設在中等偏低,大約 0.3 到 0.5 之間。設太高,畫面會像果凍一樣晃動;設太低,又像靜止圖片。與其六個鏡頭全部做成動態,不如只挑兩到三個「重點鏡頭」做動態,其他用靜態圖搭配運鏡(在剪輯軟體裡做緩慢放大或平移),這樣整體質感反而更專業,也更省時間。
第四步:進剪輯軟體組裝與配音
最後一步,把素材全部丟進你慣用的剪輯軟體,CapCut、Premiere 或 DaVinci 都可以。按照分鏡表的順序排列,靜態圖用關鍵影格做緩慢推拉,動態片段放在情緒高點。
配音的部分,現在的中文語音合成已經非常自然。你可以把旁白稿貼進語音工具,選擇「廣東話男聲」或「台灣國語女聲」,語速設在每分鐘 180 到 200 字之間最舒服。配好音之後,記得留零點五秒的頭尾空白,讓觀眾有呼吸的空間。
背景音樂建議直接用剪輯軟體內建的版權音樂庫,避免侵權問題。音量設定上,人聲保持在 -6dB 左右,音樂壓到 -20dB 以下,這樣人聲才會清楚。
整套流程跑完,熟練之後大約四十分鐘可以完成一支三十秒短片。相比傳統做法動輒三到四小時,等於省下八成時間。而且因為每個環節你都有參與,成品不會有那種「AI 味很重」的廉價感。
重點回顧與下一步
讓我幫你整理今天的核心心法:第一,不要把 AI 當全能天才,要當成分工助理,分段使用。第二,腳本階段就產出英文提示詞,能大幅提升後續生成品質。第三,圖像生成要固定角色描述與 seed 值,維持一致性。第四,影片生成只做重點鏡頭,動作幅度設中等,不要貪長。第五,剪輯與配音是品質的最後防線,人聲與音樂的音量比例要抓好。
你可以先從一支十五秒的短片開始練習,把六個鏡頭縮成三個。跑過一次完整流程之後,你會發現自己對 AI 工具的理解完全不同了。別忘了,工具再強,說故事的人還是你。現在就打開你的電腦,試著做一支屬於你的短片吧。
延伸閱讀
常見問題
Q: 我沒有獨立顯卡,跑得動 LTX-2.5 和 Qwen-Image-2.1 嗎?
A: 可以。這兩個模型都有線上版或雲端服務可以使用,也有社群提供的量化版本(GGUF 格式)能在中階顯卡上運行。如果你完全不想碰安裝,建議先用雲端平台試跑,確認流程順暢再考慮本地部署。
Q: 生成的影片畫面會扭曲或人物變形,怎麼辦?
A: 最常見的原因是動作幅度設太高,或影片長度太長。建議把動作幅度降到 0.3 到 0.5,長度控制在 5 秒內。另外,來源圖片的解析度也要夠高,低於 720p 的圖拿去生成影片,失敗率會明顯上升。
Q: 用 AI 生成的影片素材,會有版權問題嗎?
A: 開源模型生成的內容,通常依循該模型的授權條款。LTX-2.5 與 Qwen-Image-2.1 多採用寬鬆授權,商用大致沒問題,但建議你還是查一下最新條款,並且避免在提示詞中要求生成特定品牌標誌、名人肖像或受版權保護的角色,這樣最保險。
Q: 為什麼要用英文提示詞?中文不行嗎?
A: 中文提示詞現在已經堪用,但英文提示詞在多數模型的訓練資料中佔比更高,對細節、鏡位、光線的描述理解更精準。實務上建議用中文寫腳本與旁白,用英文寫畫面提示詞,兩者分工。
Q: 整套流程大概要花多少錢?
A: 如果你全部使用免費的開源模型搭配自己的電腦,成本幾乎為零。若使用雲端算力,一支三十秒短片的生成成本大約落在數十元港幣到一兩百元台幣之間,取決於你生成幾次、用哪個平台。相比外包剪輯的行情,仍然非常划算。