怎麼用
- 有原始 CSV、TXT 等檔案:選檔、看預覽,猜錯就換來源編碼,或按前三名候選。
- 只有亂碼文字:貼上文字,快速找候選。需要更多組合時按「包含東亞編碼」,等建表完成,再檢查並選用候選。
- 確認內容後,複製全文或下載 UTF-8。Excel 開 CSV 亂碼時,可先試預設的 UTF-8 含 BOM。
為什麼會亂碼?Big5 與 UTF-8 是什麼?
編碼是文字與位元組的對照方式。存檔與開檔用不同的對照方式,就可能讀成亂碼。Big5 常用來存繁體中文;UTF-8 可以表示多種語言。它們的位元組讀法不同,不能只改副檔名就完成轉換。
Excel 開 CSV 的常見亂碼狀況是讀錯文字編碼。本頁先照選定的來源編碼讀出文字,再存成 UTF-8 含 BOM,幫助開檔軟體辨認。檔案模式不改欄位、數字或公式,只換文字編碼與你選的換行。
計算依據
只取開頭最多 256 KiB 判斷:先看 BOM;沒有 BOM 時,偶數長度樣本若有至少兩成的同側位元組是 0,且超過另一側的四倍,才優先嘗試該方向的 UTF-16。其他無 BOM 的 UTF-16 不參加一般排名,但仍可手動選。接著嚴格嘗試 UTF-8,失敗才評分其他編碼。樣本尾端不完整的字元留到全文輸出時處理,開頭樣本可能漏掉後段差異。行數包含結尾換行後的空行,大檔的換行與行數只統計樣本。
評分看文字是否常見、是否有缺字或控制字元:解不出的字扣 100 分、控制字扣 40 分、私用區與罕用漢字區扣 20 分。常見漢字加 24 分、其他一般漢字加 4 分;Shift_JIS 的假名與 EUC-KR 的常見韓文音節加 24 分,其他假名加 4 分、其他韓文音節加 2 分。英數與標點加 1 分,Windows-1252 的西歐字母加 4 分,其他字扣 4 分,再除以字數。同分或相差不超過 0.5 分時優先 Big5 → GBK/GB18030 → Shift_JIS → EUC-KR,因為本站使用者多在臺灣;Windows-1252 排在這些編碼之後。GBK 與 GB18030 解出相同文字時合併候選,前三名可一點切換。前兩名分數相差不到 3 分、樣本少於 16 位元組或第一名有缺字時,會提醒自動判斷不確定。
文字模式把錯讀成 Windows-1252/Latin-1/Big5/GBK/Shift_JIS 的文字換回位元組,再嚴格嘗試 UTF-8、Big5、GBK、Shift_JIS。Windows-1252 對照由瀏覽器解碼 0–255 建立;東亞編碼按按鈕後才逐一解碼單位元組與合法雙位元組,建立反向表。不列缺字或反向對應不唯一的組合,不嘗試 GB18030 四位元組反向還原。所有結果只叫候選,不保證就是原文。
限制與其他工具
純文字單檔最多 20 MB(20,971,520 位元組)。會排除可辨認的圖片、PDF、壓縮檔與控制字元過多的內容,但無法辨認所有二進位檔,請只選純文字檔。空檔會提示。輸出只做 UTF-8,本工具不提供 Big5 輸出;若選錯來源編碼,輸出的內容也會錯。已經變成 ? 或 � 的字救不回來。大檔與進階建表會佔用記憶體,處理中可取消。
本頁處理文字編碼。要變成活頁簿用CSV 轉 Excel;換中文字形用繁簡轉換;換字元寬度用全形半形轉換;處理 Base64 或網址百分比編碼用Base64 與網址編碼;從 PDF 擷取文字用PDF 轉文字。
常見問題
CSV 用 Excel 打開是亂碼,怎麼辦?
選入原始 CSV,確認預覽的中文正確,再下載預設的 UTF-8 含 BOM。BOM 是開頭的編碼標記,能幫助開檔軟體辨認 UTF-8。若想轉成 xlsx,請改用本站 CSV 轉 Excel。
自動判斷一定正確嗎?
不一定。短文字、只有英數或多種編碼都能讀的檔案,可能猜錯。前三名只是候選,請看預覽,必要時手動選來源編碼。
已經變成問號或黑色菱形的字能救嗎?
已被換成 ? 或 � 的字,原本的位元組資訊已經丟失,無法靠本工具救回。請找原始檔或備份。原文真的有問號時,問號會保留。
可以下載 Big5 嗎?
本工具不提供 Big5 輸出。只下載 UTF-8,可選含 BOM 或不含 BOM,換行可保持原樣、改成 CRLF 或 LF。
文字模式為什麼沒有結果?
文字模式只嘗試可完整換回位元組的錯讀組合。缺字、有多個位元組對應同一字或不符合嚴格解碼的組合不列出。候選不代表已修復,請對照原文;有原始檔時優先用檔案模式。