怎麼用
- 選一個 PDF。有開啟密碼時先輸入密碼。
- 頁碼範圍可填
1-3,5,留空擷取全部。選排版與頁碼分隔後按「擷取文字」。 - 校對結果,按複製或下載。下載內容以文字框中的文字為準。
保留換行與合併段落
保留換行依文字位置整理每一行;較大的行距會留下空行。合併成段落把一般折行接起來,英文單字保留間隔,緊鄰的中文片段不額外加空白;原有空白會保留。同一行相隔超過一個字寬的片段用一個空白分隔,直排則看垂直間距。段落以行距推估,無法保證和原稿相同。
限制與相近工具
沒有文字層的頁面會提示「這一頁沒有可擷取的文字(可能是圖片或空白頁)」。缺少字元對應表可能造成亂碼或缺字。多欄可能按橫行交錯,表格框線與圖片不保留。直書多半無法還原閱讀順序,請對照原稿;少數可辨認的直排片段會依右到左、上到下整理,其他直書及混排須自行校對。
單檔限制沿用本站 PDF 轉圖片:沒有固定的 MB 上限,能否處理取決於裝置記憶體;大檔建議只選需要的頁碼。文字框會顯示已處理的選取頁數,字數以文字框的 Unicode 字元數計算,包含空白、換行與頁碼分隔。
本頁專注純文字與 TXT 排版。需要 Word 文件請用PDF 轉 Word;要保留頁面外觀請用PDF 轉圖片;掃描頁請用圖片轉文字。其他操作可到PDF 工具總覽。
常見問題
什麼樣的 PDF 可以轉成 TXT?
有文字層的 PDF 可以擷取文字。掃描或拍照的頁面通常只有圖片,本頁會列出沒有文字的頁碼,請先轉成圖片再做 OCR。空白頁也可能沒有文字。
為什麼有些字會變成亂碼?
PDF 的字型若缺少字元對應表,看到的字形可能無法對回正確的文字。本工具不能修復這種對應,請對照原稿校對。瀏覽器列印的 PDF 有時會帶入外觀相同的部首字元,預設會把已知對應換回一般字,方便搜尋;可取消「把部首字元換回一般字」保留原樣。
能保留表格、多欄和直書嗎?
TXT 只保留文字。橫排依位置從上到下、同一行由左到右排列,多欄可能左右交錯,表格沒有框線。直書多半無法還原閱讀順序,請對照原稿;少數可辨認的直排片段會依右到左、上到下整理。逐字定位、旋轉或橫直混排不保證閱讀順序。
有密碼的 PDF 怎麼處理?
選檔後輸入開啟密碼。密碼只在記憶體裡交給瀏覽器中的 PDF.js 使用,不會儲存;輸錯會顯示中文提示。按清空重來可取消讀取。
下載給 Windows 記事本要選什麼?
預設勾選「加 BOM 與 CRLF」,下載 UTF-8 文字檔並使用 Windows 換行。取消勾選則下載沒有 BOM、使用 LF 換行的 UTF-8 檔。
計算依據與程式庫
依 PDF 文字層的座標與行距整理文字,不辨識圖片。使用本站既有 PDF.js 3.11.174(Apache-2.0),worker 與字元對照表均從本站載入,不使用 CDN。