「天啊!這張收據的字完全糊掉了!」你是不是也常常遇到這種情況?手邊的文件、老照片、或是餐廳那張油油的發票,上面的字根本看不清楚。以前你可能只能嘆口氣,用手機拍下來,然後祈禱哪天需要報帳時還能辨認得出來。
但現在,情況完全不一樣了。
百度最近在 HuggingFace 上開源了一個超強的模型——Unlimited-OCR,一週內就衝上 3198 個讚,下載量突破 259 萬次。為什麼這麼紅?因為它真的做到了「把模糊變清晰」。不管你的文件是歪的、髒的、字體超小、還是光線不足,這個模型都能幫你精準辨識成可編輯的文字。
今天這篇教學,就要帶你一步一步學會使用 Unlimited-OCR,讓你從此告別手打文件的惡夢。無論你是上班族、學生、還是經常需要處理紙本文件的創業者,這篇文章都能幫你省下大量時間。準備好了嗎?我們開始吧!
為什麼你該立刻學會 Unlimited-OCR?
在開始實作之前,我們先來聊聊這個模型到底厲害在哪裡。市面上其實已經有很多 OCR(光學字元辨識)工具,像是 Google Lens、Adobe Acrobat 的 OCR 功能,甚至一些手機 App。但它們普遍有個痛點:對圖片品質要求很高。只要文件稍微模糊、傾斜、或是背景複雜,辨識率就會大幅下降,甚至直接給你一堆亂碼。
而 Unlimited-OCR 的突破在於,它把「影像還原」和「文字辨識」兩個步驟完美結合在一起。它會先自動修復圖片中的模糊、變形、噪點,然後才進行文字辨識。這就像是你先請一位修圖高手把照片修得清清楚楚,再請一位翻譯專家來閱讀上面的文字——效果當然是天差地別。
更重要的是,它是完全免費、開源的。你不需要付費訂閱,不需要擔心資料上傳到雲端被偷看,甚至可以把它下載到自己的電腦或伺服器上離線使用。對於重視隱私的香港和台灣用戶來說,這點尤其重要。
五分鐘快速上手!實際操作步驟
好,理論說完了,我們直接進入實戰環節。我假設你已經有基本的電腦操作能力,但不需要會寫程式——我會帶你走最簡單的路線。
步驟一:準備你的環境
最簡單的使用方式,是透過 HuggingFace 的線上空間(Spaces)來體驗。你不需要安裝任何東西,打開瀏覽器就能用。
- 打開瀏覽器,前往這個網址:
huggingface.co/spaces/baidu/Unlimited-OCR - 你會看到一個簡單的網頁介面,中間有一個「上傳圖片」的區域。
- 準備好你想要辨識的圖片。建議先從清晰的文件開始測試,再挑戰模糊的。
步驟二:上傳圖片並開始辨識
- 點擊「上傳圖片」按鈕,從你的電腦中選擇一張圖片。支援的格式包括 JPG、PNG、甚至 PDF。
- 上傳完成後,你會看到圖片預覽出現在畫面上。
- 在圖片下方,有一個「OCR」按鈕。直接點擊它。
- 等待幾秒鐘(根據圖片大小和伺服器負載,可能需要 5-30 秒),辨識結果就會出現在右側的文字框中。
實測案例:我拿了一張在昏暗咖啡廳拍的收據,上面的字跡因為油墨暈開幾乎無法辨認。Unlimited-OCR 不僅成功辨識出所有品項和金額,連原本我看不清楚的「服務費 10%」都正確顯示出來。這在以前根本不可能做到。
步驟三:複製、編輯與應用
辨識完成後,你可以:
- 直接點選文字框中的內容,按
Ctrl+A全選,再按Ctrl+C複製。 - 貼到 Word、Google Docs、Excel、或是任何文字編輯器中進行修改。
- 如果你需要保留排版,可以考慮將結果貼到支援表格的軟體中。
小技巧:如果辨識結果中有少數錯字,不用急著重新掃描。Unlimited-OCR 的準確率通常在 95% 以上,而且錯字通常只是相似字形的誤判(例如「O」和「0」、「l」和「1」)。手動修正一下就好,比從頭打字快太多了。
進階玩法:用 Python 批次處理大量文件
如果你需要一次處理幾十張甚至上百張文件,手動一張一張上傳就太慢了。別擔心,Unlimited-OCR 有 Python API 可以用。這裡我給你一個超簡單的腳本,你只要複製貼上就能用。
首先,在你的電腦上安裝必要的套件:
pip install transformers pillow requests
然後,建立一個新的 Python 檔案,例如 batch_ocr.py,貼上以下程式碼:
from transformers import pipeline
import os
from PIL import Image
# 初始化 OCR Pipeline
ocr_pipeline = pipeline("image-to-text", model="baidu/Unlimited-OCR")
# 設定圖片資料夾
input_folder = "./images" # 放圖片的資料夾
output_file = "ocr_results.txt"
# 開始批次處理
with open(output_file, "w", encoding="utf-8") as f:
for filename in os.listdir(input_folder):
if filename.endswith((".png", ".jpg", ".jpeg")):
image_path = os.path.join(input_folder, filename)
image = Image.open(image_path)
result = ocr_pipeline(image)
f.write(f"=== {filename} ===\n")
f.write(result[0]['generated_text'] + "\n\n")
print(f"已完成: {filename}")
print(f"所有結果已儲存到 {output_file}")
使用說明:
- 在你的電腦上建立一個資料夾叫
images。 - 把你要處理的所有圖片丟進去。
- 執行
python batch_ocr.py。 - 程式會自動讀取所有圖片,進行 OCR 辨識,並將結果輸出到
ocr_results.txt檔案中。
這個方法特別適合處理大量發票、合約、或歷史文件。我曾經用這個腳本一次處理了 200 張老照片中的手寫筆記,原本需要好幾天的工作量,現在只要幾分鐘就跑完了。
延伸閱讀
常見問題
Q: Unlimited-OCR 支援繁體中文嗎? A: 支援!Unlimited-OCR 的訓練資料包含了簡體中文、繁體中文、英文、日文、韓文等多種語言。繁體中文的辨識效果非常好,特別是印刷體。手寫體的辨識率會稍微低一些,但仍在可接受範圍內。
Q: 我的圖片很模糊,真的可以辨識嗎? A: 這正是 Unlimited-OCR 的強項!它內建的影像修復功能可以處理模糊、傾斜、光線不足、甚至部分遮擋的情況。建議圖片解析度至少 300 DPI,但即使更低,效果也比傳統 OCR 好很多。
Q: 上傳圖片會不會有隱私問題? A: 如果你使用 HuggingFace 的線上空間,圖片會暫時上傳到他們的伺服器進行處理。如果你擔心隱私,可以下載模型到自己的電腦上離線使用(需要較好的 GPU)。百度官方也提供了本地部署的詳細教學。
Q: 這個模型完全免費嗎?有沒有使用次數限制? A: 模型本身是開源且完全免費的。但如果你使用 HuggingFace 的線上空間,可能會受到免費額度的限制(例如每小時只能使用一定次數)。如果需要大量使用,建議本地部署或使用付費 API 服務。
Q: 我可以在手機上使用嗎? A: 可以!你可以用手機瀏覽器打開 HuggingFace 的線上空間,直接上傳照片進行辨識。部分開發者已經將這個模型封裝成手機 App,但目前還不是官方版本。建議先在電腦上測試,確定效果滿意後再尋找合適的行動端解決方案。