Text and Data Mining (TDM) và giấy phép CC BY trong xuất bản khoa học: Tạp chí Việt Nam cần biết gì?
Text and Data Mining (TDM — khai thác dữ liệu văn bản) là hoạt động dùng phần mềm để tự động đọc, phân tích và trích xuất thông tin từ khối lượng lớn văn bản, bao gồm cả việc các công ty AI thu thập hàng triệu bài báo khoa học để huấn luyện mô hình ngôn ngữ lớn (LLM). Giấy phép CC BY cho phép việc này hợp pháp vì không giới hạn mục đích thương mại, trong khi CC BY-NC về lý thuyết cấm dùng cho AI thương mại — nhưng thực tế thực thi gần như bằng không nếu tạp chí không chủ động khai báo quyền TDM trong metadata và chặn crawler.
Cập nhật: tháng 9/2026 — Biên soạn bởi đội ngũ VOJS, Metis JSC
TDM là gì và vì sao xuất bản khoa học đang tranh cãi về nó?
TDM là quá trình dùng máy tính quét qua lượng văn bản khổng lồ để tìm mẫu hình, trích xuất dữ kiện hoặc — trong làn sóng hiện nay — làm dữ liệu huấn luyện cho AI. Trước 2022, TDM chủ yếu phục vụ nghiên cứu học thuật (ví dụ phân tích xu hướng trích dẫn). Từ khi ChatGPT ra mắt cuối 2022, TDM trở thành hoạt động thương mại quy mô lớn: các công ty AI dùng crawler tự động (bot) quét toàn bộ trang tạp chí, kho lưu trữ và cơ sở dữ liệu học thuật để lấy văn bản train mô hình.
Vấn đề nằm ở chỗ phần lớn nội dung bị crawl mà không có thỏa thuận cấp phép rõ ràng. Bài báo Open Access — công bố miễn phí để lan tỏa tri thức — trở thành nguồn dữ liệu hấp dẫn nhất cho AI training, dẫn tới tranh cãi: giấy phép mở có đồng nghĩa "được phép dùng cho AI" hay không?
Theo Đạo luật Bản quyền Nhật Bản (Copyright Act), Điều 30-4 sửa đổi năm 2018 và có hiệu lực từ 1/1/2019, TDM — kể cả phục vụ phát triển AI thương mại — được phép thực hiện mà không cần xin phép chủ sở hữu bản quyền, miễn không làm tổn hại bất hợp lý đến lợi ích của họ. Đây là ngoại lệ TDM rộng nhất thế giới tính đến nay.
Bài viết này phân tích khung pháp lý TDM ở các khu vực chính, cách các nhà xuất bản lớn đã bắt đầu thu tiền từ AI, và quan trọng nhất — tạp chí khoa học Việt Nam có thể làm gì ngay để không bị khai thác dữ liệu miễn phí ngoài ý muốn.
CC BY có thực sự cho phép AI dùng bài báo để train mô hình không?
Có — về mặt pháp lý, giấy phép CC BY (Attribution) không giới hạn mục đích sử dụng, kể cả mục đích thương mại, miễn người dùng ghi công tác giả gốc. Điều này có nghĩa một công ty AI hoàn toàn có quyền tải bài báo CC BY về, đưa vào tập dữ liệu huấn luyện, mà không vi phạm điều khoản giấy phép — họ chỉ cần (về lý thuyết) ghi nhận nguồn.
Chi tiết về các loại giấy phép CC và cách tạp chí lựa chọn phù hợp đã được phân tích trong bài Bản quyền và giấy phép Creative Commons (CC BY) trong xuất bản khoa học. Điều bài đó chưa đề cập là khoảng trống thực thi: không có cơ chế kỹ thuật nào buộc AI phải ghi công nguồn khi tạo văn bản mới từ dữ liệu đã học — mô hình LLM "tiêu hóa" nội dung rồi sinh ra câu trả lời không kèm trích dẫn, khiến điều kiện "ghi công" của CC BY gần như vô hiệu trong thực tế.
CC BY-NC (Non-Commercial) về nguyên tắc cấm sử dụng cho mục đích thương mại — mà việc một công ty AI dùng dữ liệu để huấn luyện mô hình bán dịch vụ thương mại rõ ràng thuộc phạm vi này. Nhưng ranh giới pháp lý vẫn còn tranh cãi: một số công ty AI lập luận rằng "huấn luyện mô hình" là hành vi biến đổi (transformative use), không phải "sử dụng" trực tiếp nội dung theo nghĩa truyền thống của giấy phép CC.
Tổ chức Creative Commons chính thức thừa nhận trong tài liệu hướng dẫn công bố năm 2023 rằng bộ giấy phép CC "không được thiết kế để giải quyết các vấn đề đặc thù của AI training" — nghĩa là ngay cả bản thân Creative Commons cũng xác nhận khoảng trống pháp lý này.
Kết luận thực tế: dùng CC BY-NC không đảm bảo chặn được AI crawl dữ liệu nếu tạp chí không có thêm biện pháp kỹ thuật đi kèm (xem mục checklist bên dưới).
Khung pháp lý TDM khác nhau thế nào giữa các khu vực?
Không có luật TDM toàn cầu thống nhất — mỗi khu vực pháp lý xử lý vấn đề này khác nhau, tạo ra tình trạng "vùng xám" mà tạp chí quốc tế lẫn Việt Nam đều phải tự tìm hiểu.
| Khu vực | Cơ sở pháp lý | Đặc điểm chính |
|---|---|---|
| EU (Liên minh châu Âu) | Directive 2019/790 (DSM Copyright Directive), Điều 3 và Điều 4 | Điều 3: TDM cho nghiên cứu khoa học phi lợi nhuận luôn được phép. Điều 4: TDM cho mục đích khác (kể cả thương mại) được phép, TRỪ KHI chủ sở hữu bản quyền "opt-out" (từ chối) bằng phương tiện máy đọc được |
| Nhật Bản | Copyright Act, Điều 30-4 (sửa đổi 2018, hiệu lực 2019) | Ngoại lệ TDM rộng nhất — cho phép cả mục đích thương mại/AI, không có cơ chế opt-out |
| Hoa Kỳ | Học thuyết "Fair Use" (không có luật TDM riêng) | Chưa có án lệ tối cao xác định rõ; đang tranh chấp qua các vụ kiện lớn (xem mục tiếp theo) |
| Singapore | Copyright Act 2021, mục "Computational Data Analysis" | Cho phép TDM kể cả thương mại nếu người dùng có quyền truy cập hợp pháp vào nội dung |
| Việt Nam | Luật Sở hữu trí tuệ (sửa đổi, bổ sung năm 2022, hiệu lực 1/1/2023) | Chưa có điều khoản riêng biệt quy định về ngoại lệ TDM như EU hay Nhật Bản; các quy định về ngoại lệ bản quyền hiện hành không đề cập trực tiếp đến khai thác dữ liệu bằng AI |
Khoảng trống pháp lý của Việt Nam có hai mặt: tạp chí Việt Nam không có công cụ pháp lý rõ ràng để yêu cầu bồi thường nếu bị AI crawl trái phép, nhưng ngược lại, các đơn vị nghiên cứu trong nước cũng chưa có quy định giới hạn khi họ tự dùng TDM cho mục đích học thuật.
AI training đã biến dữ liệu xuất bản khoa học thành nguồn thu như thế nào?
Trong lúc khung pháp lý còn mơ hồ, các nhà xuất bản lớn đã chọn giải pháp thực dụng: đàm phán hợp đồng cấp phép dữ liệu trực tiếp với công ty AI thay vì chờ tòa án phân xử.
Theo báo cáo kết quả kinh doanh quý 3 năm tài chính 2024 công bố tháng 6/2024, tập đoàn xuất bản Wiley ghi nhận khoảng 23 triệu USD doanh thu từ một hợp đồng cấp phép nội dung cho một công ty phát triển mô hình ngôn ngữ lớn — được nhiều báo chí ngành xuất bản (Reuters, Publishers Weekly) đưa tin cùng thời điểm.
Tương tự, tập đoàn Informa (công ty mẹ Taylor & Francis) công bố trong báo cáo tài chính giữa năm tháng 7/2024 quan hệ đối tác AI nhiều năm với Microsoft, ghi nhận doanh thu ngay trong nửa đầu 2024 và dự kiến tăng dần theo các năm tiếp theo của hợp đồng.
Không phải mọi nhà xuất bản đều chọn hợp tác. Ở chiều ngược lại, The New York Times đã khởi kiện OpenAI và Microsoft vào ngày 27/12/2023, cáo buộc hai công ty sử dụng hàng triệu bài viết của báo này để huấn luyện mô hình mà không xin phép hay trả phí — vụ kiện vẫn đang được xử lý tại tòa án liên bang Mỹ tính đến thời điểm bài viết này được biên soạn.
Hai hướng đi này cho thấy xuất bản khoa học đang đứng trước lựa chọn tương tự: coi dữ liệu bài báo là tài sản có thể cấp phép thu phí, hoặc coi việc AI crawl trái phép là hành vi cần ngăn chặn bằng công cụ kỹ thuật và pháp lý.
Tạp chí khoa học Việt Nam có thể làm gì để kiểm soát quyền TDM?
Không cần đợi Luật Sở hữu trí tuệ Việt Nam có điều khoản TDM riêng, tạp chí vẫn có ba lớp công cụ kỹ thuật để chủ động kiểm soát việc AI crawl dữ liệu — áp dụng được ngay cả với tòa soạn không có phòng pháp chế.
Bước 1 — Chặn hoặc cho phép AI crawler qua robots.txt
Các công ty AI lớn công bố tên user-agent riêng cho crawler thu thập dữ liệu training, tách biệt với crawler phục vụ tìm kiếm. Tạp chí có thể chặn riêng nhóm crawler AI mà không ảnh hưởng đến việc được Google Scholar lập chỉ mục:
text
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: ClaudeBot
Disallow: /GPTBot là crawler thu thập dữ liệu training của OpenAI, Google-Extended là chỉ thị riêng Google giới thiệu năm 2023 cho phép website chặn dữ liệu dùng để huấn luyện Gemini/Bard mà vẫn giữ nguyên khả năng xuất hiện trên Google Search, CCBot thuộc tổ chức phi lợi nhuận Common Crawl — nguồn dữ liệu train phổ biến của nhiều mô hình AI mã nguồn mở.
Bước 2 — Khai báo quyền TDM trong metadata Crossref
Khi đăng ký DOI qua Crossref, tạp chí có thể gắn trường license_ref với thuộc tính applies_to="tdm" — cho phép hệ thống quốc tế nhận diện chính xác: giấy phép đọc thông thường có thể khác với giấy phép khai thác dữ liệu tự động. Đây là cơ chế được Crossref hỗ trợ từ nhiều năm nay nhưng phần lớn tạp chí Việt Nam — kể cả tạp chí đã có DOI — chưa từng khai báo trường này.
Bước 3 — Dùng TDM Reservation Protocol nếu tạp chí phục vụ độc giả EU
Hiệp hội STM (International Association of Scientific, Technical and Medical Publishers) phối hợp với IFRRO công bố TDM Reservation Protocol năm 2022 — một chuẩn kỹ thuật máy đọc được để nhà xuất bản chính thức "opt-out" theo Điều 4 của EU Copyright Directive. Tạp chí Việt Nam có tác giả hoặc hợp tác xuất bản với đối tác châu Âu nên tìm hiểu áp dụng chuẩn này để quyền từ chối TDM có hiệu lực pháp lý tại EU.
Checklist áp dụng ngay cho tạp chí Việt Nam
- Kiểm tra file
robots.txthiện tại của website tạp chí — hầu hết tạp chí chạy OJS mặc định chưa từng cấu hình chặn AI crawler - Quyết định lập trường: cho phép AI crawl miễn phí (chấp nhận đánh đổi lấy khả năng được AI Overview/Perplexity trích dẫn) hay chặn hoàn toàn
- Nếu chọn chặn, cập nhật
robots.txtvới danh sách user-agent AI (cập nhật định kỳ vì công ty AI liên tục ra crawler mới) - Rà soát giấy phép CC đang dùng — nếu ban biên tập muốn kiểm soát chặt AI thương mại, cân nhắc CC BY-NC thay vì CC BY mặc định
- Với tạp chí đã đăng ký DOI, liên hệ đơn vị vận hành hệ thống (như VOJS) để bổ sung trường
license_ref applies_to="tdm"vào metadata gửi Crossref
Sai lầm thường gặp của tạp chí Việt Nam về TDM và AI licensing
Qua quá trình tư vấn triển khai hệ thống quản lý tạp chí, đội ngũ VOJS ghi nhận một số ngộ nhận lặp lại:
- Nhầm lẫn "Open Access" với "được phép dùng cho AI training" — nhiều ban biên tập nghĩ bài OA đương nhiên ai muốn dùng gì cũng được, trong khi giấy phép cụ thể (CC BY vs CC BY-NC) mới là yếu tố quyết định, như đã phân tích trong bài Tạp chí khoa học mở (Open Access) tại Việt Nam
- Không biết website của mình đang bị AI crawler thu thập dữ liệu — vì
robots.txtmặc định của OJS không chặn crawler AI, phần lớn tạp chí Việt Nam đang bị crawl toàn bộ kho bài mà không hề hay biết - Coi đây là vấn đề "của tạp chí lớn" — thực tế công ty AI train mô hình đa ngôn ngữ, kể cả nội dung tiếng Việt dung lượng nhỏ cũng có giá trị dữ liệu huấn luyện, không phân biệt quy mô tạp chí
- Chờ luật rồi mới hành động — trong khi Luật Sở hữu trí tuệ Việt Nam chưa có điều khoản TDM riêng, biện pháp kỹ thuật (robots.txt, metadata) vẫn có thể triển khai ngay, không cần chờ khung pháp lý hoàn chỉnh
Vấn đề này có liên hệ trực tiếp với chủ đề rộng hơn đã phân tích trong bài AI trong xuất bản khoa học: Ứng dụng, giới hạn và tác động đến tạp chí Việt Nam — TDM là mặt "đầu vào" của AI (dữ liệu huấn luyện), trong khi bài đó tập trung vào mặt "đầu ra" (AI hỗ trợ viết, phản biện).
Câu hỏi thường gặp về TDM và giấy phép AI trong xuất bản khoa học
TDM là gì trong xuất bản khoa học?
TDM (Text and Data Mining) là việc dùng phần mềm tự động đọc và phân tích khối lượng lớn văn bản, bao gồm cả việc công ty AI thu thập bài báo khoa học để huấn luyện mô hình ngôn ngữ. Trong xuất bản khoa học, TDM vừa phục vụ nghiên cứu học thuật hợp pháp (phân tích xu hướng trích dẫn) vừa là nguồn tranh cãi bản quyền khi bị dùng cho AI thương mại không xin phép.
CC BY có ngăn được AI dùng bài báo để train mô hình không?
Không. CC BY cho phép sử dụng cho mọi mục đích kể cả thương mại, miễn ghi công tác giả — nên về mặt pháp lý, AI hoàn toàn có quyền dùng nội dung CC BY để huấn luyện mô hình mà không vi phạm giấy phép.
Tạp chí muốn chặn AI crawl dữ liệu thì phải làm gì trước tiên?
Cập nhật file robots.txt của website để chặn riêng các user-agent crawler AI như GPTBot, Google-Extended, CCBot, ClaudeBot — đây là bước kỹ thuật đơn giản nhất, không cần thay đổi giấy phép CC đang dùng và không ảnh hưởng đến việc được Google Scholar lập chỉ mục.
Luật Sở hữu trí tuệ Việt Nam có bảo vệ tạp chí khỏi bị AI khai thác dữ liệu không?
Luật Sở hữu trí tuệ Việt Nam (sửa đổi, bổ sung năm 2022, hiệu lực từ 1/1/2023) hiện chưa có điều khoản riêng biệt về ngoại lệ hay quyền TDM như EU hay Nhật Bản. Tạp chí Việt Nam do đó phải dựa chủ yếu vào biện pháp kỹ thuật (robots.txt, metadata) thay vì công cụ pháp lý riêng cho TDM.
Tạp chí Việt Nam quy mô nhỏ có nên đàm phán hợp đồng cấp phép dữ liệu AI như Wiley không?
Với phần lớn tạp chí Việt Nam, đàm phán trực tiếp với công ty AI chưa khả thi vì thiếu vị thế thương lượng và khối lượng dữ liệu đủ lớn để hấp dẫn đối tác. Ưu tiên thực tế hơn là kiểm soát bằng công cụ kỹ thuật miễn phí (robots.txt, khai báo metadata TDM) trước, đàm phán thương mại chỉ phù hợp với nhà xuất bản có kho dữ liệu lớn.
AI crawl dữ liệu bài báo có ảnh hưởng đến việc bài được AI search trích dẫn không?
Có mối quan hệ ngược: nếu tạp chí chặn hoàn toàn crawler AI, bài báo sẽ khó xuất hiện khi người dùng hỏi ChatGPT, Perplexity hay Google AI Overviews — vì các công cụ này cần crawl được nội dung để trích dẫn. Đây là đánh đổi tạp chí cần cân nhắc: bảo vệ dữ liệu tuyệt đối hay chấp nhận rủi ro đổi lấy khả năng được AI search giới thiệu tới độc giả mới.
Giấy phép nào phù hợp nhất nếu tạp chí vừa muốn Open Access vừa muốn kiểm soát AI training?
Không có giấy phép CC nào giải quyết trọn vẹn vấn đề này vì bộ giấy phép CC không được thiết kế riêng cho AI. Giải pháp thực tế là kết hợp: giữ CC BY để đáp ứng yêu cầu DOAJ và quỹ tài trợ, đồng thời bổ sung biện pháp kỹ thuật (robots.txt chặn AI crawler, khai báo license_ref applies_to="tdm" riêng biệt trong metadata Crossref) để kiểm soát thêm ở lớp kỹ thuật.
Tóm tắt
- TDM (Text and Data Mining) là hoạt động dùng phần mềm khai thác văn bản quy mô lớn — nay chủ yếu gắn với việc AI thu thập dữ liệu huấn luyện mô hình
- CC BY cho phép AI dùng bài báo cho mục đích thương mại hợp pháp; CC BY-NC cấm về nguyên tắc nhưng thực thi yếu nếu không có công cụ kỹ thuật đi kèm
- EU (Directive 2019/790) và Nhật Bản (Điều 30-4, 2018) đã có luật TDM rõ ràng; Việt Nam và Mỹ vẫn ở vùng xám pháp lý
- Wiley và Taylor & Francis/Informa đã ghi nhận doanh thu hàng chục triệu USD từ cấp phép dữ liệu cho AI trong năm 2024, trong khi New York Times chọn khởi kiện OpenAI/Microsoft (27/12/2023)
- Tạp chí Việt Nam có thể chủ động ngay bằng ba công cụ miễn phí: chặn AI crawler qua
robots.txt, khai báo quyền TDM trong metadata Crossref, và áp dụng TDM Reservation Protocol (STM/IFRRO, 2022) nếu hợp tác với đối tác châu Âu
Về nội dung bài viết
Bài viết được biên soạn bởi đội ngũ VOJS — Metis JSC, dựa trên kinh nghiệm triển khai hệ thống quản lý tạp chí khoa học và theo dõi các diễn biến pháp lý, thương mại liên quan đến AI và xuất bản học thuật. Nguồn tham khảo chính: EU Directive 2019/790 (DSM Copyright Directive); Japan Copyright Act Điều 30-4; Creative Commons Organization — hướng dẫn về AI (2023); báo cáo tài chính Wiley quý 3 FY2024 (công bố 6/2024) và Informa interim results (công bố 7/2024); hồ sơ vụ kiện The New York Times Company v. Microsoft Corporation, OpenAI (nộp 27/12/2023); STM Association & IFRRO — TDM Reservation Protocol (2022); Luật sửa đổi, bổ sung một số điều của Luật Sở hữu trí tuệ Việt Nam (2022).
Bài viết liên quan
- Bản quyền và giấy phép Creative Commons (CC BY) trong xuất bản khoa học
- AI trong xuất bản khoa học: Ứng dụng, giới hạn và tác động đến tạp chí Việt Nam
- Tạp chí khoa học mở (Open Access) tại Việt Nam
- Crossref và DOI là gì? Tại sao tạp chí khoa học cần đăng ký DOI
- Tạp chí khoa học là gì? Định nghĩa, đặc điểm và vai trò
- Liên hệ triển khai VOJS cho tạp chí của bạn
