PDF 基礎知識
文字型 PDF 與掃描 PDF 有什麼不同?先判斷再編輯
兩份在閱讀器裡看起來完全相同的檔案,進入編輯器後可能有截然不同的結果;關鍵在於頁面存的是文字物件、影像,或兩者混合。
文字型 PDF 裡面存了什麼
文字型 PDF 會保存字元、座標、字型參照、大小、顏色與繪製指令,常見來源包括 Word、Google 文件、排版軟體或報表系統的直接匯出。PDF 閱讀器依這些指令畫出頁面。
因為字元真的存在,軟體通常能搜尋、擷取,有時也能替換。不過 PDF 並不等於原始文件:一句話可能拆成許多文字片段,各行位置彼此獨立,原始字型也可能只嵌入文件曾用到的部分字形。
掃描 PDF 裡面存了什麼
基本掃描檔每頁只存一張照片。畫面上的字是像素,不是字元,就像手機照片中的招牌文字不會自動變成可編輯文字;拖曳句子或搜尋通常沒有反應。
有些掃描器會建立「可搜尋掃描檔」:畫面仍是影像,背後另放一層看不見的 OCR 文字。這種檔案可能能選取,但辨識字元與框線位置未必準確;只替換隱藏文字層,也不會把影像裡原本的字擦掉。
上傳前可自行完成的三項檢查
第一,在常用 PDF 閱讀器拖曳一小段句子;若能依字詞乾淨選取,通常有可用文字層。第二,用尋找功能搜尋頁面上的明顯詞語。第三,放大檢查:掃描文字通常會出現像素或壓縮痕跡,繪製文字則多半保持銳利。
這些只是線索,不是保證。轉成外框的文字會保持銳利,實際上卻是向量圖形;字元編碼損壞時可能看似能選,複製後卻是亂碼。同一份文件也可能有些頁是文字、有些頁是掃描。
- 選取一句話,貼到純文字編輯器檢查。
- 搜尋頁面上辨識度高的詞。
- 文件來源混合時,不要只測試封面。
- 敏感文件應先在本機檢查,不要只為判斷類型就上傳。
OCR 在流程中的位置
光學字元辨識會分析頁面像素,推測字元、詞語與閱讀順序。OCR 能建立可搜尋文字層或新文件,但不能還原原始來源檔;解析度、歪斜、手寫、語言、表格與印刷品質都會影響準確率。
OCR 後要特別校對姓名、數字、日期、小數點與法律條款。長篇或重要掃描檔應逐頁對照影像。本站不執行 OCR;遇到掃描或純影像檔會拒絕處理,避免讓使用者以為不可靠的修改已成功。
依文件類型選擇下一步
若文字能正常選取,而且只需少量替換,可使用本站編輯。若要大幅重排、改字型或持續反覆修訂,回到原始 Word、試算表、排版或報表來源通常更可靠。
掃描檔應先用可信任的 OCR 流程,再校對後編輯。若 PDF 已簽章、受保護、含表單或屬正式紀錄,請保留原檔並先確認是否允許修改;光看外觀無法判斷編輯是否合適。