你曾經為了一段 YouTube 上的英文教學影片,卻沒有中文字幕而煩惱嗎?或是手上有國外的產品發表會錄影,但老闆要你「明天之前生出中文版」?

以前的做法是:打開翻譯軟體,一句一句聽寫、翻譯、對時間軸。一段 10 分鐘的影片,搞掉你整個下午。

但現在,AI 工具已經成熟到可以幫你自動完成「聽 → 翻 → 貼 → 唸」四個步驟。今天這篇教學,就是要教你如何串聯這些免費或平價的 AI 工具,把一部外語影片變成有中文字幕、甚至中文配音的完成品。

整個流程只需要三個主要工具,而且大部分環節都可以在瀏覽器上完成。你會發現,原本需要十小時的苦工,現在只要一小時就能搞定。準備好了嗎?我們直接開始。

為什麼你不再需要手動翻譯影片?

先說一個真實案例。我有一個朋友在科技媒體工作,每週要處理 3-5 段來自 NVIDIA、Google、OpenAI 的發表會片段。以前他的流程是:先下載影片,用聽寫軟體生成英文字幕,然後一句一句手動翻譯,最後用剪輯軟體套上中文字幕。

一段 8 分鐘的影片,他平均花 6 小時。後來他改用 AI 工作流,同樣的影片現在只要 40 分鐘。省下來的時間,他用來寫更深入的分析文章,業績直接翻倍。

這個工作流的核心概念叫做「語音辨識 → 機器翻譯 → 字幕生成 → 語音合成」。聽起來很複雜,但實際上你只需要學會三個步驟:提取聲音並轉成文字、把文字翻譯成中文、最後把字幕貼回影片。如果連配音都想要,再加一個步驟就好。

現在市面上的工具已經非常友善。語音辨識推薦用 OpenAI Whisper,它免費、開源,而且支援 99 種語言,準確率高得嚇人。翻譯部分可以用 DeepL 或 Google Translate,但如果你想要專業一點的翻譯品質,我會推薦你使用 Claude 或 ChatGPT,因為它們能理解上下文,不會把「Apple」翻成「蘋果公司」或「蘋果水果」搞混。

第一步:用 Whisper 自動聽寫出字幕

首先,你需要從影片中提取音軌,然後交給 AI 去聽寫。這是最重要的一步,因為如果聽寫出來的文字錯誤太多,後面的翻譯也會跟著歪掉。

我推薦使用 Whisper 的線上版本,比如 Replicate 平台上的 Whisper 模型,或是直接在你的電腦上安裝 OpenAI Whisper。如果你是初學者,可以先從網頁版開始。

操作步驟如下:

  1. 準備影片檔案。你可以從 YouTube 下載 MP4,或是直接上傳你手邊的影片檔。
  2. 打開 Whisper 工具。如果你用 Mac 或 Windows,可以安裝 whisper 套件:pip install openai-whisper,然後在終端機輸入 whisper 你的影片.mp4 --language English --output_format srt
  3. 等待幾分鐘。Whisper 會自動分析音軌,輸出一個 .srt 字幕檔。這個檔案裡面已經有時間軸和英文句子了。
  4. 檢查品質。打開 SRT 檔,快速掃過一遍。Whisper 的準確率通常在 95% 以上,但如果有專業術語(比如「transformer architecture」),可能會誤判。這時你可以手動修正幾個明顯的錯誤。

舉例來說,我最近處理一段 NVIDIA 的 GTC 發表會影片,Whisper 把「Hopper architecture」聽成「Hopper architect」,但這種錯誤很少,而且通常只出現在專有名詞上。修正完之後,你的英文字幕就準備好了。

第二步:用 AI 翻譯字幕,保留時間軸

有了 SRT 檔之後,接下來就是翻譯。這裡有一個關鍵:不要用逐句複製貼上到 Google 翻譯,因為那樣會破壞時間軸格式,而且翻譯品質很差。

更好的做法是使用 ClaudeChatGPT 來批次翻譯。你可以直接把整個 SRT 檔貼給 AI,並下這樣的指令:

「請將以下 SRT 字幕檔案翻譯成繁體中文。保持時間軸格式不變。注意:這是科技發表會內容,請使用台灣/香港常用的科技用語。例如 ‘machine learning’ 翻成『機器學習』,‘GPU’ 保留不翻。」

AI 會回傳一個全新的 SRT 檔,每一句都已經翻譯好,時間軸完全對齊。這個方法最大的優點是:AI 會根據上下文做出更好的翻譯選擇。

舉個例子,英文句子「We are shipping this feature in the next quarter」,如果逐字翻譯可能會變成「我們正在運送這個功能在下一個季度」,但 AI 知道這裡的「shipping」是「推出」的意思,所以會翻成「我們將在下個季度推出這個功能」。

你可以用 Claude 或 ChatGPT 的網頁版,也可以透過 API 批次處理大量檔案。對於一般使用者,網頁版就夠了。記得在指令中指定「繁體中文」(Traditional Chinese),因為很多 AI 預設是簡體中文。

第三步:把字幕嵌入影片或生成配音

翻譯好的 SRT 檔,現在有兩個選擇:一是直接當作字幕掛在影片上,二是進一步用 AI 生成中文配音。

選項 A:嵌入字幕

如果你只是要一個有中文字幕的影片,最簡單的工具是 CapCut(剪映)或 DaVinci Resolve。以 CapCut 為例:

  1. 打開 CapCut,導入原始影片。
  2. 點選「文字」→「字幕」→「導入字幕」,選擇你剛剛翻譯好的 SRT 檔。
  3. 調整字體大小、顏色和位置。我建議用白色字體加黑色描邊,這樣在任何背景上都看得清楚。
  4. 導出影片。

整個過程大約 10 分鐘。如果你不想安裝軟體,也可以用 VEED.io 這類線上工具,直接上傳影片和 SRT 檔,系統會自動合成。

選項 B:生成中文配音

如果你想要連聲音都變成中文,那就需要 AI 語音合成工具。推薦 ElevenLabsMicrosoft Azure Speech。以 ElevenLabs 為例:

  1. 打開 ElevenLabs 的 Text-to-Speech 功能。
  2. 選擇一個中文語音模型。ElevenLabs 支援多種中文口音,包括台灣國語和香港粵語。
  3. 將翻譯好的字幕文字貼入,設定語速和語調。
  4. 導出音檔。
  5. 用剪輯軟體把原始影片的音軌靜音,換上這個 AI 配音。

要注意的是,AI 配音目前還是會有「機器感」,尤其是長句子。但對於內部使用、教學影片或社交媒體內容來說,品質已經足夠。如果你想追求更自然的聲音,可以考慮使用 Fish AudioCosyVoice 這類開源工具,它們的聲音更像真人。

實戰案例:10 分鐘影片變中文版

讓我用一個實際案例來統整整個流程。假設你有一段 10 分鐘的 Google I/O 發表會影片,目標是產出中文版上傳到你的 YouTube 頻道。

  1. 下載影片(2 分鐘):用 yt-dlp 或線上工具下載 MP4。
  2. Whisper 聽寫(5 分鐘):用 Replicate 網頁版,上傳後等 3 分鐘取得 SRT。
  3. AI 翻譯(3 分鐘):把 SRT 貼給 Claude,下指令要求繁體中文和科技用語。
  4. 修正與校對(10 分鐘):快速掃過翻譯結果,檢查專有名詞和語意。這一步很重要,因為 AI 有時候會把「TensorFlow」翻成「張量流」之類的奇怪詞。
  5. 嵌入字幕(10 分鐘):用 CapCut 導入影片和 SRT,調整字體後導出。
  6. 可選:生成配音(15 分鐘):用 ElevenLabs 生成中文語音,替換原始音軌。

總時間:約 45 分鐘。如果用手動方式,光是聽寫就要 2 小時,翻譯 4 小時,對時間軸 2 小時,總共 8 小時以上。AI 工作流直接幫你省下 90% 的時間。

延伸閱讀

常見問題

Q: Whisper 免費嗎?有沒有次數限制? A: Whisper 是開源且免費的。如果你在自己的電腦上安裝使用,完全沒有次數限制。如果用 Replicate 或 HuggingFace 的線上版,通常有免費額度(例如 Replicate 提供 $5 美元的免費額度),用完後需要付費。

Q: AI 翻譯的品質夠好嗎?會不會出現奇怪的翻譯? A: 對於一般科技、新聞、教學內容,品質已經相當高。但對於文學性強、有雙關語或文化梗的內容,建議人工校對一次。另外,專有名詞(如公司名、產品名)有時會被誤翻,記得在指令中要求保留原文。

Q: 有沒有 All-in-One 的工具,不用分三步驟? A: 有,例如 Rask.aiHeyGen 提供一站式的影片翻譯和配音服務,甚至可以同步嘴型。但這些服務通常需要付費(每月 $20-50 美元)。如果你只是偶爾需要,分三步驟用免費工具更划算。

Q: 繁體中文和簡體中文在翻譯時要注意什麼? A: 很多 AI 模型預設輸出簡體中文,所以指令中一定要寫「繁體中文」。此外,用詞習慣也不同,台灣常用「滑鼠」「硬碟」,香港常用「滑鼠」「硬碟」但口語可能用「mouse」「harddisk」。建議在指令中指定地區用語。

Q: 影片有背景音樂或多人對話,Whisper 能處理嗎? A: Whisper 對背景音樂的容忍度很高,但如果音樂太大聲或多人同時講話,準確率會下降。建議使用影片的乾淨音軌(沒有背景音樂的版本),或是在 Whisper 設定中開啟 --condition_on_previous_text 參數來提升準確度。