怎麼用
- 在「原本的版本」與「修改後的版本」貼上文字,或各載入一個檔案。
- 選擇忽略哪些差異與行內標示的細度,再按「開始比對」。處理中可以取消。
- 看統計、切換並排或合併,用上一處與下一處尋找差異。需要留存時複製或下載 .txt。
每個選項是什麼意思
- 忽略英文大小寫:把 A 到 Z 當作小寫,例如 Hello 與 hello 相同。
- 忽略行首行尾空白:每行兩端的空白不計,例如「 文字 」與「文字」相同。
- 忽略所有空白:去掉行內空格、全形空格與定位字元,例如「a b」與「ab」相同,但不合併不同行。
- 忽略空行:跳過只有空白的行,例如 a、空行、b 與 a、b 相同。
- 逐字:以 Unicode 字元標示,例如「今天」改成「明天」只標「今/明」;組合 emoji 可能分成數個字元。
- 逐詞:連續英文字母或數字視為一個單位,例如 hello 改為 help 會標整個單字;中日韓文字每字一個單位。
並排與合併怎麼看
並排左邊是原版,右邊是新版;成對修改的行會對齊,行內不同的字會加標示。合併把刪除行與新增行上下排列,手機預設用這種方式。窄螢幕的並排結果可以在結果區左右捲動。
只看差異會保留前後各 3 行相同內容,其餘折疊;點「略過 n 行相同內容」可展開。複製與下載仍包含完整比對,不受折疊影響。
統計與相似度怎麼算
每段連續不同內容,把刪除與新增按順序配對算修改行;剩下的才算新增或刪除。相同行按所選忽略規則判斷。比對先把 CRLF、CR 統一成 LF;空字串是 0 行,其餘以 LF 分行,結尾換行會留下最後一個空行。
相似度是字元層級的粗略數字:把套用忽略規則後各行用 LF 接起來,逐個 Unicode 字元計次數;共同字元數取兩邊各字元次數的較小值,相似度=共同字元數 × 2 ÷ 兩邊總字元數 × 100%,四捨五入到小數第 1 位。兩邊都是空字串為 100%。它不看順序或語意,例如 ab 與 ba 仍是 100%,不能判斷原創性。
下載為 UTF-8、LF 換行,每一行前面用「+」「-」或一個空白表示新增、刪除或相同。啟用忽略選項時,共同行以原版文字匯出,被忽略的空行不匯出,因此不適合用來還原未正規化的新版。選項全關時可逐行還原兩版。
載入檔案的限制
純文字先用 UTF-8(含 BOM),有 BOM 的 UTF-16 則按其位元組順序讀取;UTF-8 無法解碼時試 Big5,框下方會顯示編碼。無 BOM 的 UTF-16 不會自動判定;編碼錯誤時請先轉成 UTF-8。每個檔案上限 20 MB,每邊上限 200 萬 Unicode 字元或 20,000 行。
Word 只取 .docx 的內文段落、換行與定位點,表格逐格取文字,一列一行並用定位字元分隔。不取頁首頁尾、註腳、文字方塊與追蹤修訂裡被刪除的內容;舊 .doc 不支援。瀏覽器須支援解開 deflate-raw 壓縮,否則請改用貼上。
PDF 只取文字層,依文字座標與行距整理,換行位置可能與原稿不同;多欄、直書與缺少字元對照表的文件須自行校對。加密檔請先用PDF 解密取得可讀版本;掃描檔請先用圖片轉文字。本頁不比對格式、圖片或表格框線。
本頁專注兩版差異。只想算長度請用字數計算,調整英文大小寫請用英文大小寫轉換;單份文件擷取請用PDF 轉文字或PDF 轉 Word。
常見問題
可以比對 Word 或 PDF 嗎?
可以載入 .docx 的內文與 PDF 的文字層,再比對文字。舊版 .doc 請先另存成 .docx;掃描 PDF 請先做圖片文字辨識。格式與圖片不在比對範圍。
為什麼看起來一樣卻顯示不同?
空白、全形半形與換行位置都可能不同。可用忽略空白選項排除部分差異;本頁把 CRLF 與 CR 換成 LF,但保留結尾換行,不會自動轉換全形半形。
文字與檔案會被上傳或保存嗎?
文字與檔案在你的瀏覽器裡處理,不會上傳,也不寫入瀏覽器儲存空間。重新整理會清空內容;下載的檔案由你自行保管。
最多可以比對多長的文字?
本站限制每個檔案 20 MB,每邊文字 200 萬字元或 20,000 行。結尾換行會多算一個空行。差異很多時會較慢,可以按取消,或分段比對。
可以比對程式碼嗎?
可以。請貼上程式碼或載入純文字檔;若要檢查縮排差異,請不要勾選忽略空白。這裡只比較文字,不會執行程式碼。
相似度能用來做抄襲檢測嗎?
不能。相似度只按兩邊字元的出現次數粗略計算,不看語意與來源,也不能判斷原創性。字元順序不同仍可能得到 100%。
技術說明與來源
最短編輯腳本(Myers 差異演算法),在瀏覽器的背景工作執行緒處理;單行超過 5,000 字元,或兩行內容差異太大時,不做行內細分,改標整行。結果分批顯示,可取消處理。
PDF 文字擷取使用 PDF.js 3.11.174(Apache-2.0),worker 與字元對照表從本站載入,不使用 CDN。PDF 加密判斷使用 pdf-lib(MIT)。Word ZIP 與 XML 讀取及文字比對由本站程式處理,沒有另加程式庫。