Kiểm tra trùng lặp tự động tích hợp trong hệ thống quản lý tạp chí: iThenticate là gì?
iThenticate là gì? iThenticate là công cụ kiểm tra trùng lặp văn bản do công ty Turnitin phát triển dành riêng cho nội dung học thuật và chuyên môn, được nhiều tạp chí khoa học và nhà xuất bản quốc tế sử dụng để so sánh bài nộp với hàng tỷ tài liệu học thuật, tạp chí và trang web nhằm phát hiện dấu hiệu trùng lặp trước khi đưa vào phản biện.
Cập nhật: tháng 7/2026 — Biên soạn bởi đội ngũ VOJS, Metis JSC
iThenticate là gì và hoạt động như thế nào?
iThenticate quét toàn văn bài nộp và đối chiếu với kho dữ liệu khổng lồ gồm bài báo đã xuất bản, luận văn, sách và nội dung web để tạo ra một báo cáo tương đồng (similarity report) thể hiện tỷ lệ phần trăm văn bản trùng khớp với các nguồn đã tồn tại.
Báo cáo tương đồng của iThenticate không tự động kết luận một bài có đạo văn hay không — công cụ chỉ chỉ ra mức độ trùng lặp văn bản, việc đánh giá đạo văn thực sự vẫn cần con người xem xét ngữ cảnh trích dẫn.
Kết quả trả về dưới dạng phần trăm tổng thể kèm bảng chi tiết từng nguồn trùng khớp, giúp biên tập viên nhanh chóng xác định đoạn văn nào cần rà soát kỹ, phân biệt giữa trích dẫn hợp lệ có chú thích và sao chép không ghi nguồn.
Cơ sở dữ liệu đối chiếu của iThenticate lớn đến mức nào?
Quy mô kho dữ liệu đối chiếu là yếu tố quyết định độ tin cậy của một công cụ kiểm tra trùng lặp — càng đối chiếu được nhiều nguồn, kết quả càng sát thực tế. Theo dữ liệu công bố của Turnitin/iThenticate, kho dữ liệu học thuật của công cụ này bao gồm:
- Hơn 40 triệu bài báo nghiên cứu đã xuất bản từ hơn 590 nhà xuất bản khoa học, kỹ thuật và y khoa toàn cầu.
- Hơn 1 triệu tóm tắt và trích dẫn từ PubMed.
- Hơn 20.000 đầu tạp chí nghiên cứu từ EBSCOhost và Gale InfoTrac OneFile.
- Nội dung học thuật từ mạng lưới hơn 1.500 nhà xuất bản thông qua Crossref, cùng dữ liệu mở từ CORE và luận văn/luận án từ ProQuest.
Các nhà xuất bản lớn như IEEE, Springer Nature, Wiley và Elsevier tích hợp trực tiếp iThenticate (qua dịch vụ CrossCheck của Crossref) vào hệ thống biên tập điện tử của họ, biến bước kiểm tra trùng lặp thành một phần bắt buộc trong quy trình xử lý bài, chứ không phải bước kiểm tra rời rạc, thủ công.
Kho dữ liệu quy mô này là lý do căn bản khiến kiểm tra thủ công không thể thay thế được: không biên tập viên nào có thể tự mình đối chiếu một bản thảo với hàng chục triệu bài báo đã xuất bản trên toàn cầu.
Vì sao không nên kiểm tra đạo văn thủ công?
Kiểm tra thủ công bằng cách đọc và so sánh bài nộp với trí nhớ hoặc tìm kiếm rời rạc trên Google gần như không thể phát hiện được trùng lặp với hàng triệu tài liệu học thuật đã xuất bản trên toàn cầu.
Biên tập viên đọc thủ công chỉ có thể nhận ra đạo văn khi tình cờ biết đến nguồn gốc đoạn văn, trong khi phần lớn trường hợp trùng lặp đến từ tài liệu chuyên ngành hẹp mà người đọc không thể nhớ hết. Quy trình thủ công cũng tốn nhiều thời gian của tòa soạn, kéo dài giai đoạn tiền xử lý trước khi bài được chuyển sang phản biện khoa học.
Việc thiếu công cụ kiểm tra trùng lặp hệ thống hóa còn khiến tạp chí dễ bỏ sót các trường hợp tự đạo văn (self-plagiarism) — khi tác giả tái sử dụng nội dung từ chính bài đã công bố trước đó mà không trích dẫn, một vi phạm đạo đức xuất bản ngày càng phổ biến.
Lợi ích khi tích hợp iThenticate vào hệ thống quản lý tạp chí
Tích hợp iThenticate trực tiếp vào hệ thống quản lý tạp chí giúp quy trình kiểm tra trùng lặp diễn ra tự động ngay khi tác giả nộp bài, không cần biên tập viên thao tác thủ công qua nhiều bước.
| Tiêu chí | Kiểm tra thủ công | Tích hợp iThenticate tự động |
|---|---|---|
| Thời gian xử lý | Vài ngày đến hàng tuần | Vài phút sau khi nộp bài |
| Phạm vi đối chiếu | Trí nhớ, tìm kiếm rời rạc | Hàng tỷ tài liệu học thuật, web |
| Tính nhất quán | Phụ thuộc từng biên tập viên | Áp dụng đồng nhất mọi bài nộp |
| Lưu vết hồ sơ | Rời rạc, khó truy xuất | Lưu tự động trong hệ thống |
| Rủi ro bỏ sót | Cao | Thấp hơn đáng kể |
Khi báo cáo tương đồng được gắn thẳng vào hồ sơ bài nộp trong hệ thống quản lý tạp chí khoa học, ban biên tập có thể xem kết quả ngay tại thời điểm ra quyết định desk review, rút ngắn đáng kể thời gian từ lúc nhận bài đến lúc chuyển phản biện.
Ngưỡng tỷ lệ trùng lặp bao nhiêu là chấp nhận được?
Không có con số cố định áp dụng chung cho mọi tạp chí, nhưng chính sách công khai của nhiều nhà xuất bản lớn như Elsevier, Springer, Wiley và Taylor & Francis đều lấy mốc 15% tổng thể làm ngưỡng chấp nhận được để chuyển tiếp phản biện, mức 16-25% thường yêu cầu chỉnh sửa, và trên 25% phần lớn bị trả lại hoặc từ chối thẳng.
"Ngay cả khi tỷ lệ tương đồng tổng thể ở mức 15%, nếu đó là một khối văn bản liên tục sao chép từ cùng một nguồn, kết quả vẫn phải được coi là dấu hiệu đạo văn nghiêm trọng cần xử lý — con số tổng không thay thế được việc đọc chi tiết từng đoạn trùng khớp." — nguyên tắc phổ biến trong chính sách kiểm tra trùng lặp của các nhà xuất bản quốc tế.
Tỷ lệ trùng lặp cần được đọc kèm chi tiết nguồn, không chỉ nhìn con số tổng. Một bài có 20% trùng lặp nhưng chủ yếu từ phần phương pháp nghiên cứu chuẩn hoặc trích dẫn có chú thích rõ ràng khác hẳn về bản chất so với bài có cùng tỷ lệ nhưng trùng lặp tập trung ở phần kết quả và bàn luận. Một số tạp chí, ví dụ chính sách công khai của AIJR Publisher, còn quy định thêm ngưỡng riêng cho từng nguồn đơn lẻ — không quá 3% trùng lặp từ một nguồn duy nhất, kể cả khi tổng thể vẫn dưới 15%.
Tòa soạn nên xây dựng chính sách ngưỡng riêng phù hợp với đặc thù ngành, vì các ngành như y học, luật thường có tỷ lệ trùng lặp tự nhiên cao hơn do thuật ngữ chuyên môn và cấu trúc câu chuẩn hóa.
Sai lầm thường gặp khi tòa soạn triển khai kiểm tra trùng lặp tự động
Nhiều tòa soạn Việt Nam đã có công cụ kiểm tra trùng lặp nhưng vẫn để lọt bài có vấn đề, thường do quy trình sử dụng công cụ chưa đúng cách chứ không phải do công cụ kém chính xác.
- Chỉ nhìn con số phần trăm tổng, không mở báo cáo chi tiết nguồn — bỏ sót trường hợp trùng lặp tập trung nghiêm trọng ở phần kết quả dù tỷ lệ tổng thể thấp.
- Áp dụng một ngưỡng chung cho mọi chuyên ngành — khiến bài ngành y, luật bị từ chối oan vì thuật ngữ chuẩn hóa, trong khi bài ngành xã hội học có tỷ lệ thấp nhưng đạo văn ý tưởng lại lọt qua.
- Không kiểm tra lại bản thảo đã chỉnh sửa (revised manuscript) — tác giả có thể chèn thêm đoạn sao chép mới ở vòng sửa bài mà tòa soạn không chạy lại báo cáo tương đồng.
- Bỏ qua phần phụ lục, bảng biểu và tài liệu bổ sung (supplementary materials) — chỉ chạy kiểm tra trên file bản thảo chính, trong khi đạo văn dữ liệu thường ẩn trong phần phụ lục.
- Không lưu trữ báo cáo tương đồng gắn với từng phiên bản bài nộp — khi có tranh chấp hoặc khiếu nại sau xuất bản, tòa soạn không có bằng chứng đối chiếu theo từng mốc thời gian.
Quy trình đề xuất khi tích hợp kiểm tra trùng lặp vào tòa soạn
Xây dựng quy trình rõ ràng giúp việc sử dụng iThenticate phát huy hiệu quả tối đa thay vì chỉ chạy báo cáo cho có.
- Chạy kiểm tra ngay khi nhận bài, trước bước phân công phản biện, để tránh lãng phí thời gian phản biện viên với bài có vấn đề rõ ràng.
- Biên tập viên đọc chi tiết báo cáo nguồn, không chỉ dựa vào con số phần trăm tổng thể.
- Thiết lập ngưỡng cảnh báo nội bộ theo từng chuyên ngành thay vì áp một mức chung cho toàn tạp chí.
- Lưu trữ báo cáo tương đồng trong hồ sơ bài nộp để làm bằng chứng minh bạch khi cần giải trình với hội đồng hoặc cơ quan quản lý.
- Kết hợp với chính sách công khai cho tác giả biết trước bài sẽ được kiểm tra trùng lặp tự động, tăng tính răn đe và minh bạch.
Câu hỏi thường gặp
iThenticate khác gì so với việc tự tìm kiếm trên Google? iThenticate đối chiếu với cơ sở dữ liệu học thuật chuyên biệt gồm hàng tỷ bài báo, luận văn, sách đã xuất bản mà công cụ tìm kiếm thông thường không thể truy cập đầy đủ, đồng thời tạo báo cáo tương đồng có cấu trúc thay vì kết quả rời rạc.
Tỷ lệ trùng lặp cao có đồng nghĩa với đạo văn không? Không hoàn toàn. Tỷ lệ trùng lặp cao có thể đến từ trích dẫn hợp lệ, thuật ngữ chuyên ngành hoặc phần phương pháp chuẩn hóa; biên tập viên vẫn cần đọc chi tiết nguồn trùng khớp để đánh giá đúng bản chất.
Tạp chí nhỏ có cần tích hợp kiểm tra trùng lặp tự động không? Có. Quy mô tạp chí không làm giảm rủi ro đạo văn; ngược lại tạp chí nhỏ thường thiếu nhân lực rà soát thủ công nên càng cần công cụ tự động để đảm bảo chất lượng đồng đều.
Kiểm tra trùng lặp có thay thế được phản biện khoa học không? Không. Đây là bước sàng lọc kỹ thuật trước phản biện, giúp loại bỏ sớm các bài có vấn đề rõ ràng, nhưng đánh giá chất lượng học thuật và tính mới vẫn cần phản biện khoa học (peer review) thực hiện.
Có cần chạy lại kiểm tra trùng lặp sau khi tác giả nộp bản sửa không? Có, và đây là bước nhiều tòa soạn bỏ sót. Bản thảo sau chỉnh sửa có thể chứa đoạn nội dung mới chưa từng được quét, nên quy trình chuẩn là chạy lại báo cáo tương đồng ở mỗi vòng nộp bản sửa quan trọng, không chỉ ở lần nộp đầu tiên.
Chi phí tích hợp iThenticate vào hệ thống quản lý tạp chí có cao không? Chi phí phụ thuộc vào gói dịch vụ và số lượng bài kiểm tra mỗi năm mà tòa soạn đăng ký với Turnitin/iThenticate hoặc qua dịch vụ CrossCheck của Crossref, dao động theo quy mô tạp chí. Tòa soạn nhỏ nên cân nhắc gói tính theo số lượt quét thay vì thuê bao trọn gói nếu số bài nộp hàng năm chưa lớn.
Tóm tắt
- iThenticate là công cụ kiểm tra trùng lặp văn bản chuyên dụng cho học thuật, tạo báo cáo tương đồng đối chiếu với hàng tỷ tài liệu.
- Kiểm tra thủ công không đủ khả năng đối chiếu với khối lượng tài liệu học thuật toàn cầu và tốn nhiều thời gian tòa soạn.
- Tích hợp trực tiếp vào hệ thống quản lý tạp chí giúp quy trình tự động, nhất quán và rút ngắn thời gian xử lý bài.
- Ngưỡng tỷ lệ trùng lặp cần đọc kèm chi tiết nguồn, không chỉ dựa vào con số tổng thể.
Nguồn tham khảo: Turnitin/iThenticate Publisher Resources; chính sách kiểm tra trùng lặp công khai của Elsevier, Springer, Wiley, Taylor & Francis, AIJR Publisher. Biên soạn bởi đội ngũ VOJS, Metis JSC.
