Skip to content

Phần mềm kiểm tra trùng lặp luận văn: Kiểm Tra Tài Liệu, Turnitin, DoIT — chọn công cụ nào?

Phần mềm kiểm tra trùng lặp luận văn là công cụ so khớp văn bản của bạn với kho dữ liệu tham chiếu (bài báo, luận văn đã nộp, trang web công khai) rồi trả về tỷ lệ trùng lặp kèm báo cáo chi tiết từng đoạn. Tại Việt Nam, bốn cái tên phổ biến nhất là Kiểm Tra Tài Liệu (kiemtratailieu.vn) — công cụ trong nước có kho dữ liệu tiếng Việt, phù hợp để sinh viên tự kiểm tra trước khi nộp; Turnitin — nền tảng quốc tế nhiều trường tích hợp vào hệ thống nộp bài; DoIT — hệ thống do Đại học Quốc gia Hà Nội phát triển, dùng nội bộ ở nhiều cơ sở đào tạo; và iThenticate — chuyên cho bản thảo bài báo khoa học. Nguyên tắc chọn: văn bản tiếng Việt tự kiểm tra trước khi nộp thì ưu tiên công cụ có kho dữ liệu tiếng Việt; bản nộp chính thức thì dùng đúng công cụ trường hoặc tạp chí quy định — vì hai công cụ khác nhau gần như chắc chắn cho hai con số % khác nhau trên cùng một bài.

Cập nhật: tháng 8/2026 — Biên soạn bởi đội ngũ UniDoc


Phần mềm kiểm tra trùng lặp hoạt động như thế nào?

Mọi phần mềm kiểm tra trùng lặp đều làm ba việc: tách văn bản đầu vào thành các chuỗi ngắn, so khớp các chuỗi đó với kho dữ liệu tham chiếu, rồi tổng hợp thành similarity index (tỷ lệ trùng lặp tổng) kèm similarity report (báo cáo chỉ rõ từng đoạn trùng với nguồn nào).

Ba yếu tố quyết định chất lượng kết quả, và cũng là ba tiêu chí so sánh công cụ:

  1. Kho dữ liệu tham chiếu — quan trọng nhất. Công cụ chỉ phát hiện được trùng lặp với những gì nó có trong kho. Một luận văn chép từ khóa luận tiếng Việt chưa từng công bố trên web sẽ "sạch" trên công cụ quốc tế nếu kho của công cụ đó không chứa luận văn tiếng Việt.
  2. Khả năng xử lý ngôn ngữ — tiếng Việt có dấu thanh, từ ghép, biến thể chính tả (y/i, cách bỏ dấu cũ/mới). Công cụ tối ưu cho tiếng Anh có thể bỏ sót các đoạn đã bị sửa nhẹ kiểu này.
  3. Cấu hình loại trừ — có loại trừ trích dẫn trong ngoặc kép, danh mục tài liệu tham khảo hay không. Cùng một bài, bật/tắt loại trừ có thể chênh nhau nhiều điểm phần trăm.

Tỷ lệ trùng lặp do phần mềm trả về không đồng nghĩa với đạo văn: một đoạn trích dẫn đúng chuẩn vẫn hiện trùng lặp nhưng hợp lệ, còn một đoạn diễn giải sai cách có thể "sạch" trên phần mềm mà vẫn vi phạm. Kết luận cuối cùng luôn thuộc về con người đọc báo cáo chi tiết.

Phân biệt đạo văn với trùng lặp, và ngưỡng % chấp nhận được ở các trường Việt Nam, đã phân tích kỹ trong bài đạo văn là gì, ngưỡng trùng lặp bao nhiêu % là chấp nhận được.

Bốn công cụ phổ biến tại Việt Nam: đặc điểm từng công cụ

Kiểm Tra Tài Liệu (kiemtratailieu.vn) — công cụ tiếng Việt cho người tự kiểm tra

Kiểm Tra Tài Liệu là công cụ kiểm tra trùng lặp trong nước, xây dựng kho dữ liệu tham chiếu tập trung vào tài liệu tiếng Việt — luận văn, khóa luận, giáo trình, bài viết web tiếng Việt — nên bắt tốt các đoạn trùng mà công cụ quốc tế dễ bỏ sót.

Điểm phù hợp nhất của nhóm công cụ này: sinh viên, học viên tự kiểm tra độc lập trước khi nộp. Turnitin và DoIT thường chỉ truy cập được qua tài khoản do trường cấp, và nhiều trường giới hạn số lần nộp thử; công cụ tự kiểm tra cho phép chạy sớm, chạy nhiều lần trong quá trình viết — phát hiện đoạn trùng khi mới viết 2 trang dễ sửa hơn nhiều so với phát hiện ở trang 60.

Cách dùng hiệu quả: chạy lần đầu khi xong chương cơ sở lý thuyết (chương thường trùng lặp cao nhất), sửa theo báo cáo chi tiết, rồi chạy lại bản hoàn chỉnh trước khi nộp bản chính thức qua hệ thống của trường.

Turnitin — chuẩn quốc tế, mạnh với tiếng Anh và kho bài nộp sinh viên

Turnitin là nền tảng kiểm tra trùng lặp được hàng nghìn cơ sở giáo dục trên thế giới sử dụng, trong đó có nhiều trường đại học Việt Nam tích hợp vào hệ thống nộp bài (thường qua LMS như Moodle, Canvas). Thế mạnh: kho bài nộp khổng lồ từ sinh viên các trường đối tác cộng với nội dung web và cơ sở dữ liệu xuất bản; từ 2023 bổ sung tính năng nhận diện văn bản do AI tạo (AI writing detection).

Hạn chế với người dùng Việt Nam: cá nhân không mua lẻ được tài khoản chính thống (Turnitin bán theo giấy phép tổ chức); kho tài liệu tiếng Việt mỏng hơn kho tiếng Anh; và nếu trường bật chế độ lưu bài vào kho (standard repository), bản nộp thử của chính bạn có thể khiến bản nộp thật sau đó báo trùng gần 100% — cần hỏi rõ giáo vụ chế độ nộp trước khi chạy thử trên hệ thống trường.

DoIT — hệ thống của Đại học Quốc gia Hà Nội

DoIT là hệ thống hỗ trợ kiểm tra trùng lặp văn bản do Đại học Quốc gia Hà Nội phát triển, được dùng trong nội bộ ĐHQGHN và một số cơ sở đào tạo khác tại Việt Nam. Ưu điểm là xử lý tiếng Việt và kho dữ liệu học thuật trong nước; nhược điểm là quyền truy cập phụ thuộc đơn vị — sinh viên thường nộp qua khoa/thư viện chứ không tự chạy tùy ý.

Nếu trường bạn chấm bằng DoIT, con số cuối cùng có giá trị là con số DoIT trả về — kết quả tự kiểm tra bằng công cụ khác chỉ mang tính tham khảo để sửa bài trước.

iThenticate — cho bài báo khoa học nộp tạp chí

iThenticate (cùng công ty với Turnitin) chuyên cho bản thảo học thuật, được tích hợp vào hệ thống Similarity Check của Crossref mà nhiều nhà xuất bản quốc tế sử dụng để sàng lọc bản thảo trước phản biện. Nghiên cứu sinh chuẩn bị công bố quốc tế nên biết: tỷ lệ trùng lặp cao ở bước này là một trong các lý do dẫn đến desk reject — bị từ chối trước khi vào vòng phản biện, như đã phân tích trong bài cấu trúc bài báo khoa học IMRAD.

Bảng so sánh: chọn công cụ nào cho tình huống nào?

Tiêu chíKiểm Tra Tài LiệuTurnitinDoITiThenticate
Kho dữ liệu mạnh nhấtTài liệu tiếng Việt (luận văn, web, giáo trình)Bài nộp sinh viên quốc tế, web, xuất bản tiếng AnhTài liệu học thuật trong nước (ĐHQGHN và đối tác)Bài báo, bản thảo xuất bản quốc tế
Cá nhân tự dùng được?Có — dịch vụ mở cho người dùng lẻKhông — chỉ qua tài khoản trường cấpKhông — qua đơn vị đào tạoHạn chế — chủ yếu qua tổ chức, nhà xuất bản
Xử lý tiếng ViệtTốt (tối ưu cho tiếng Việt)Trung bìnhTốtTrung bình
Phù hợp nhất choTự kiểm tra trong lúc viết, trước khi nộpBản nộp chính thức ở trường dùng TurnitinBản nộp chính thức ở trường dùng DoITBản thảo bài báo gửi tạp chí quốc tế
Nhận diện văn bản AITùy phiên bản dịch vụCó (từ 2023)Không công bốCó (bản dành cho nhà xuất bản)

Quy tắc rút gọn: công cụ tự kiểm tra chọn theo ngôn ngữ văn bản; công cụ nộp chính thức chọn theo quy định của trường/tạp chí — không có quyền chọn. Hai việc này bổ trợ nhau, không thay thế nhau.

Vì sao cùng một bài, hai công cụ ra hai con số % khác nhau?

Cùng một luận văn có thể ra 12% trên công cụ này và 27% trên công cụ khác — cả hai đều "đúng" theo cách đo của mình. Bốn nguyên nhân chính:

  1. Kho dữ liệu khác nhau. Công cụ có kho luận văn tiếng Việt sẽ bắt được các đoạn trùng với khóa luận khóa trước — thứ công cụ quốc tế không nhìn thấy.
  2. Cấu hình loại trừ khác nhau. Loại trừ hay không loại trừ trích dẫn trong ngoặc kép, danh mục tham khảo, đoạn trùng ngắn dưới ngưỡng ký tự — mỗi lựa chọn thay đổi con số tổng.
  3. Cách tách và so khớp chuỗi khác nhau. Độ dài chuỗi so khớp tối thiểu, cách xử lý dấu câu, khoảng trắng, ký tự đặc biệt.
  4. Thời điểm quét khác nhau. Kho dữ liệu web thay đổi liên tục; bài quét tháng trước và tháng sau có thể chênh vài phần trăm dù văn bản không đổi.

Không so sánh trực tiếp con số % giữa hai công cụ khác nhau. Con số duy nhất có giá trị quyết định là con số từ công cụ mà trường hoặc tạp chí của bạn dùng để chấm — mọi công cụ khác chỉ để tham khảo và sửa bài sớm.

Hệ quả thực dụng: khi tự kiểm tra bằng Kiểm Tra Tài Liệu ra 18% mà ngưỡng trường là 25%, đừng coi là "đã an toàn tuyệt đối" — hãy đọc báo cáo chi tiết, sửa hết các đoạn trùng không phải trích dẫn hợp lệ, để chừa biên độ cho khác biệt giữa hai công cụ.

Cách đọc similarity report cho đúng — không chỉ nhìn con số %

Báo cáo chi tiết quan trọng hơn con số tổng. Quy trình đọc 4 bước:

  1. Xem phân bố trùng lặp theo chương. Trùng lặp dồn vào chương cơ sở lý thuyết (nhiều định nghĩa, trích dẫn) ít đáng ngại hơn trùng lặp nằm trong chương kết quả — nơi phải là nội dung nguyên bản.
  2. Đối chiếu từng đoạn trùng với nguồn được chỉ ra. Phân loại từng đoạn thành ba nhóm: trích dẫn hợp lệ (có ngoặc kép + nguồn), cần diễn giải lại, cần bổ sung trích dẫn.
  3. Chú ý các nguồn trùng lặp lớn. Một nguồn duy nhất chiếm 8–10% tổng tỷ lệ là tín hiệu xấu hơn hai mươi nguồn mỗi nguồn 0,5% — nó cho thấy bài dựa quá nặng vào một tài liệu.
  4. Sửa bằng paraphrase đúng cách, không "lách" phần mềm. Đổi từ đồng nghĩa hàng loạt, chèn ký tự ẩn là gian lận nặng hơn cả đạo văn ban đầu nếu bị phát hiện. Quy trình diễn giải lại 4 bước có trong bài cách paraphrase đúng cách để tránh đạo văn.

Sai lầm thường gặp khi dùng phần mềm kiểm tra trùng lặp

Các lỗi này lặp lại ở hầu hết mùa bảo vệ, và đều tránh được:

  • Chỉ kiểm tra một lần vào ngày nộp. Phát hiện 30% trùng lặp trước hạn nộp 24 giờ thì không còn thời gian sửa tử tế — dẫn đến sửa ẩu bằng công cụ đổi từ đồng nghĩa, làm bài tối nghĩa. Kiểm tra theo mốc: xong chương lý thuyết, xong bản nháp đầy đủ, trước khi nộp bản cuối.
  • Nộp thử lên hệ thống lưu kho của trường. Với Turnitin chế độ standard repository, bản nộp thử được lưu vào kho — bản nộp thật sau đó báo trùng gần 100% với chính nó. Luôn hỏi giáo vụ chế độ nộp (no repository / draft) trước khi chạy thử trên hệ thống trường; muốn chạy thử tự do thì dùng công cụ độc lập bên ngoài.
  • Tin ngưỡng % chung trên mạng thay vì quy định của trường. Ngưỡng 20–30% chỉ là thông lệ tham khảo; con số ràng buộc nằm trong quy định liêm chính khoa học hoặc hướng dẫn trình bày luận văn của chính trường bạn.
  • Coi tỷ lệ thấp là "không đạo văn". Đạo văn dịch (dịch tài liệu tiếng Anh sang tiếng Việt không ghi nguồn) và đạo văn ý tưởng gần như không bị phần mềm so khớp cùng ngôn ngữ phát hiện — nhưng người phản biện đọc rộng vẫn nhận ra.
  • Gửi file cho dịch vụ "hạ tỷ lệ trùng lặp" trôi nổi. Ngoài rủi ro gian lận, bản thảo chưa bảo vệ gửi cho bên không rõ danh tính có thể bị lộ, thậm chí bị bán lại — chọn dịch vụ kiểm tra có danh tính pháp lý rõ ràng.

Cách bền vững nhất để không phải "chữa cháy" trước hạn nộp: kiểm soát trùng lặp ngay trong lúc soạn thảo. Trên UniDoc, kiểm tra trùng lặp chạy song song với kiểm tra chính tả, văn phong ngay trong trình soạn thảo — cảnh báo hiện tại đúng vị trí đoạn có vấn đề, không phải đợi xuất file rồi đối chiếu thủ công; cách bật tính năng có trong hướng dẫn sử dụng UniDoc.

Quy trình tự kiểm tra trùng lặp trước khi nộp (checklist áp dụng ngay)

  • [ ] Xác nhận công cụ và ngưỡng % chính thức trường/khoa dùng để chấm (hỏi giáo vụ hoặc đọc quy định trình bày luận văn)
  • [ ] Hỏi rõ chế độ nộp trên hệ thống trường: có lưu bài vào kho không, được nộp thử mấy lần
  • [ ] Chạy kiểm tra độc lập lần 1 khi xong chương cơ sở lý thuyết (ví dụ qua Kiểm Tra Tài Liệu)
  • [ ] Đọc báo cáo chi tiết, phân loại từng đoạn trùng: hợp lệ / cần paraphrase / cần bổ sung trích dẫn
  • [ ] Sửa bằng diễn giải đúng cách, không dùng công cụ đổi từ đồng nghĩa hàng loạt
  • [ ] Chạy lại bản hoàn chỉnh, chừa biên độ ít nhất 5 điểm % dưới ngưỡng của trường (do khác biệt giữa các công cụ)
  • [ ] Rà lần cuối: trích dẫn trong bài khớp danh mục tham khảo, đoạn trích nguyên văn có ngoặc kép + số trang

Câu hỏi thường gặp

Sinh viên tự kiểm tra trùng lặp luận văn ở đâu khi không có tài khoản Turnitin?

Dùng công cụ kiểm tra độc lập mở cho người dùng lẻ, ưu tiên công cụ có kho dữ liệu tiếng Việt như Kiểm Tra Tài Liệu nếu luận văn viết bằng tiếng Việt. Kết quả này dùng để phát hiện và sửa sớm các đoạn trùng; con số quyết định cuối cùng vẫn là con số từ công cụ trường dùng để chấm.

Kết quả Kiểm Tra Tài Liệu có giống kết quả Turnitin hoặc DoIT không?

Không giống, và không công cụ nào giống công cụ nào — vì kho dữ liệu, cấu hình loại trừ và thuật toán so khớp khác nhau. Với văn bản tiếng Việt, công cụ có kho tiếng Việt thường bắt được nhiều đoạn trùng hơn công cụ quốc tế. Cách dùng đúng là sửa hết các đoạn trùng không hợp lệ mà báo cáo chỉ ra và chừa biên độ dưới ngưỡng của trường, thay vì kỳ vọng hai con số trùng khớp.

Tỷ lệ trùng lặp bao nhiêu % thì luận văn được chấp nhận?

Mỗi trường tự quy định; thông lệ phổ biến tại Việt Nam là khóa luận, luận văn dưới 20–30%, luận án tiến sĩ dưới 20%, bài báo gửi tạp chí quốc tế dưới 15–20%. Con số ràng buộc luôn nằm trong quy định của chính trường hoặc tạp chí bạn nộp — chi tiết ngưỡng và cách hiểu đúng có trong bài đạo văn là gì, ngưỡng trùng lặp bao nhiêu %.

Kiểm tra trùng lặp có phát hiện được văn bản do AI viết không?

Kiểm tra trùng lặp và nhận diện văn bản AI là hai chức năng khác nhau. Văn bản AI tạo mới thường có tỷ lệ trùng lặp thấp vì không sao chép nguyên văn nguồn nào; phát hiện nó cần công cụ AI detection riêng — Turnitin có tính năng này từ 2023, độ chính xác vẫn gây tranh cãi. Ranh giới dùng AI hợp lệ và vi phạm đã phân tích trong bài AI viết luận văn có bị coi là đạo văn không.

Nộp thử lên Turnitin của trường có làm bản nộp thật bị báo trùng 100% không?

Có thể, nếu hệ thống được cấu hình lưu bài vào kho (standard repository) — bản nộp thật sẽ trùng với chính bản nộp thử trước đó. Hỏi giáo vụ trước khi nộp thử; nhiều trường cấu hình chế độ nháp (draft/no repository) cho các lần nộp thử, hoặc giảng viên có thể loại trừ bài nộp trước của chính sinh viên khi đọc báo cáo.

Phần mềm có phát hiện được đạo văn dịch từ tiếng Anh sang tiếng Việt không?

Phần mềm so khớp văn bản cùng ngôn ngữ gần như không phát hiện được đạo văn dịch. Dạng này chủ yếu bị phát hiện bởi người phản biện nhận ra cấu trúc lập luận trùng với tài liệu gốc tiếng nước ngoài, hoặc bởi công cụ so khớp đa ngôn ngữ mà một số hệ thống lớn đang phát triển. Tỷ lệ % thấp vì vậy không phải bằng chứng "không đạo văn".

UniDoc thay thế được phần mềm kiểm tra trùng lặp không?

UniDoc bổ trợ, không thay thế bước kiểm tra chính thức của trường. Điểm khác biệt là thời điểm: UniDoc cảnh báo trùng lặp ngay trong lúc soạn thảo — kèm kiểm tra chính tả, trích dẫn và khóa thể thức trình bày — giúp bản thảo sạch trước khi đến bước quét chính thức, thay vì phát hiện vấn đề khi bài đã hoàn chỉnh.

Tóm tắt

  • Bốn công cụ phổ biến tại Việt Nam chia theo vai trò: Kiểm Tra Tài Liệu (tự kiểm tra, mạnh tiếng Việt), Turnitin (nộp chính thức ở trường dùng Turnitin, mạnh tiếng Anh + AI detection), DoIT (hệ thống ĐHQGHN và các đơn vị dùng), iThenticate (bản thảo bài báo quốc tế).
  • Công cụ tự kiểm tra chọn theo ngôn ngữ văn bản; công cụ nộp chính thức do trường/tạp chí quy định — hai việc bổ trợ nhau.
  • Cùng một bài, các công cụ ra con số % khác nhau do kho dữ liệu, cấu hình loại trừ, thuật toán khác nhau — không so sánh chéo, và chừa biên độ ít nhất 5 điểm % dưới ngưỡng của trường khi tự kiểm tra.
  • Đọc similarity report chi tiết quan trọng hơn con số tổng: xem phân bố theo chương, phân loại từng đoạn trùng, chú ý nguồn trùng lớn.
  • Kiểm tra theo mốc trong lúc viết (xong chương lý thuyết, xong bản nháp, trước bản cuối) thay vì một lần vào ngày nộp; không nộp thử lên hệ thống lưu kho của trường khi chưa hỏi rõ cấu hình.

Nguồn tham khảo: thông lệ ngưỡng trùng lặp quan sát từ quy định trình bày luận văn của các cơ sở đào tạo tại Việt Nam; Turnitin — tài liệu về similarity report và AI writing detection (2023); Crossref Similarity Check (iThenticate) — quy trình sàng lọc bản thảo của các nhà xuất bản; Đại học Quốc gia Hà Nội — hệ thống hỗ trợ kiểm tra trùng lặp DoIT. Biên soạn bởi đội ngũ UniDoc.

Bài viết liên quan

Cập nhật gần nhất: