Phát triển trí tuệ nhân tạo và sử dụng dữ liệu có bản quyền: Bài học từ một tranh chấp

Tài nguyên
Phát triển trí tuệ nhân tạo và sử dụng dữ liệu có bản quyền: Bài học từ một tranh chấp
Ngày đăng: 22/08/2025

    Trong thời đại công nghệ trí tuệ nhân tạo (AI) phát triển mạnh mẽ, việc sử dụng dữ liệu để huấn luyện các mô hình AI đã trở thành yếu tố cốt lõi để tạo ra những sản phẩm cạnh tranh. Tuy nhiên, việc sử dụng dữ liệu có bản quyền mà không được phép có thể dẫn đến các tranh chấp pháp lý nghiêm trọng, gây tổn thất tài chính và uy tín. Vụ kiện Thomson Reuters Enterprise Centre GmbH và West Publishing Corp. v. Ross Intelligence Inc. (2025)[1] tại Tòa án Quận Delaware, Hoa Kỳ là một ví dụ điển hình, minh họa rõ ràng những rủi ro khi vi phạm bản quyền trong quá trình phát triển AI.

     

     

    Thomson Reuters khởi kiện Ross Intelligence

    Thomson Reuters, chủ sở hữu nền tảng nghiên cứu pháp lý Westlaw, là một trong những công ty hàng đầu cung cấp dữ liệu pháp lý, bao gồm án lệ, luật, quy định, tạp chí pháp lý, và các chú thích biên tập (headnotes) được tổ chức theo Hệ thống Số khóa (Key Number System). Những headnotes này, dù dựa trên án lệ không có bản quyền, được coi là tác phẩm sáng tạo vì quá trình biên tập và tổng hợp, do đó được bảo vệ bởi luật bản quyền. Ross Intelligence Inc., (Ross) một công ty khởi nghiệp, phát triển một công cụ tìm kiếm pháp lý dựa trên AI để cạnh tranh với Westlaw. Để huấn luyện AI, Ross cần một lượng lớn dữ liệu pháp lý, nhưng bị Thomson Reuters từ chối cấp phép sử dụng nội dung của Westlaw.

    Sau đó Ross đã hợp tác với LegalEase, một bên thứ ba, để tạo ra các "Bulk Memos" – tập hợp các câu hỏi và câu trả lời pháp lý dựa trên headnotes của Westlaw. Mặc dù LegalEase được hướng dẫn không sao chép trực tiếp headnotes, nhưng các câu hỏi trong Bulk Memos lại có sự tương đồng đáng kể với headnotes, dẫn đến cáo buộc vi phạm bản quyền từ Thomson Reuters. Vào năm 2023, Thẩm phán Stephanos Bibas ban đầu từ chối hầu hết các yêu cầu phán quyết tóm tắt của Thomson Reuters, nhưng sau khi nghiên cứu sâu hơn, ông sửa đổi ý kiến vào năm 2025. Tòa án kết luận rằng Ross đã vi phạm bản quyền đối với 2.243 headnotes, bác bỏ các lập luận của Ross, bao gồm sử dụng hợp lý (fair use), vi phạm vô ý, lạm dụng bản quyền, và các học thuyết pháp lý khác. Vụ kiện nhấn mạnh rằng việc sử dụng dữ liệu có bản quyền để huấn luyện AI, ngay cả ở bước trung gian, có thể dẫn đến hậu quả pháp lý nghiêm trọng.

    Góc nhìn pháp lý từ vụ việc

    Cáo buộc vi phạm bản quyền trực tiếp

    Thomson Reuters cáo buộc Ross vi phạm bản quyền trực tiếp đối với các headnotes và Key Number System của Westlaw. Tòa án xác định rằng:

    • Tính hợp lệ của bản quyền. Headnotes và Key Number System đáp ứng ngưỡng tính nguyên bản (originality) theo tiền lệ Feist Publications, Inc. v. Rural Tel. Serv. Co. (1991)[2]. Headnotes là sản phẩm của sự biên tập sáng tạo, tương tự như một tác phẩm điêu khắc được chạm khắc từ đá (án lệ không có bản quyền). Key Number System, dù dựa trên các chủ đề pháp lý phổ biến, vẫn là một hệ thống tổ chức độc lập của Thomson Reuters.
    • Sao chép thực tế và tương đồng đáng kể. Báo cáo chuyên gia của Ross thừa nhận rằng 2.243 câu hỏi trong Bulk Memos rất giống với headnotes của Westlaw, nhưng khác với án lệ gốc. Thẩm phán đã so sánh từng cặp headnote, câu hỏi, và án lệ, kết luận rằng sự tương đồng này là bằng chứng rõ ràng của vi phạm.

    Lập luận về việc sử dụng hợp lý

    Ross viện dẫn căn cứ việc sử dụng hợp lý theo Chương 17, Luật Bản quyền của Hoa Kỳ[3], nhưng bị tòa án bác bỏ dựa trên phân tích bốn yếu tố gồm:

    1. Mục đích và tính chất sử dụng.

    Việc Ross sử dụng headnotes là thương mại và không mang tính biến đổi (transformative), vì công cụ AI của Ross cạnh tranh trực tiếp với Westlaw. Việc sao chép trung gian (intermediate copying) không được coi là sử dụng hợp lý, vì không liên quan đến mã máy tính như trong các vụ án Google v. Oracle (2021)[4] hoặc Sony v. Connectix (2000).

    1. Tính chất của tác phẩm có bản quyền.

    Headnotes và Key Number System có tính sáng tạo, nhưng không ở mức cao như tiểu thuyết hay nghệ thuật, nên yếu tố này nghiêng về Ross, nhưng ít quan trọng.

    1. Số lượng và mức độ quan trọng của phần được sử dụng.

    Sản phẩm cuối cùng của Ross (là các án lệ) không hiển thị headnotes, nên yếu tố này nghiêng về Ross.

    1. Ảnh hưởng đến thị trường.

    Ross làm suy giảm thị trường hiện tại đó là thị trường nghiên cứu pháp lý và tiềm năng dữ liệu huấn luyện AI của Thomson Reuters, khiến yếu tố này nghiêng về Thomson Reuters. Đây là yếu tố quan trọng nhất, dẫn đến việc bác bỏ phòng vệ sử dụng hợp lý của Ross.

    Các lập luận khác

    Ross đưa ra các phòng vệ như vi phạm vô ý, lạm dụng bản quyền, học thuyết hợp nhất (merger doctrine), và scenes à faire, nhưng tất cả đều bị bác bỏ. Đặc biệt, tòa án nhấn mạnh rằng headnotes có thông báo bản quyền, loại bỏ khả năng giảm thiệt hại do vi phạm vô ý, và Thomson Reuters không lạm dụng bản quyền để kìm hãm cạnh tranh.

     

     

    Bài học cho các công ty công nghệ Việt Nam

    Vụ kiện này cung cấp nhiều bài học quan trọng cho Việt Nam, nơi ngành công nghệ AI đang phát triển nhanh chóng nhưng luật sở hữu trí tuệ vẫn còn nhiều thách thức trong việc áp dụng vào các công nghệ mới. Dưới đây là các bài học cụ thể:

    Thứ nhất, tôn trọng quyền sở hữu trí tuệ và xin phép sử dụng dữ liệu

    Vụ kiện cho thấy rằng việc sử dụng dữ liệu có bản quyền mà không được phép, ngay cả qua bên thứ ba, có thể dẫn đến vi phạm bản quyền. Tại Việt Nam, Luật Sở hữu trí tuệ 2005, đã được sửa đổi 2009, 2022 bảo vệ các tác phẩm sáng tạo, bao gồm cả các tổng hợp hoặc biên tập dữ liệu. Các công ty công nghệ, như FPT, VinAI, hoặc các startup AI, cần: (i) Kiểm tra tính hợp lệ của bản quyền. Trước khi sử dụng dữ liệu từ các nguồn như sách, báo, hoặc cơ sở dữ liệu pháp lý Thư viện pháp luật, Luật Việt Nam hay website của một công ty luật cần xác minh xem dữ liệu có phải là dữ liệu công cộng như là luật gốc do Nhà nước ban hành hay dữ liệu được hình thành và phát triển cũng như được bảo vệ bởi một cá nhân, tổ chức hay không. (ii) Đàm phán cấp phép. Trường hợp xác định dữ liệu thuộc sở hữu của bên thứ ba, cần ký hợp đồng cấp phép rõ ràng hoặc ít nhất là văn bản cho phép sử dụng dữ liệu từ chủ sở hữu dữ liệu. (iii) Đào tạo nhân viên. Các công ty cần tổ chức các khóa học về luật sở hữu trí tuệ, quyền tác giả để đảm bảo nhân viên và các bên thực hiện hiểu rõ trách nhiệm pháp lý khi sử dụng dữ liệu do người khác tạo nên và sở hữu.

    Thứ hai, phân biệt dữ liệu công cộng và dữ liệu có bản quyền

    Tòa án xác định rằng headnotes của Westlaw, dù dựa trên án lệ công cộng, vẫn được bảo vệ vì tính sáng tạo trong biên tập. Tại Việt Nam, các công ty nên:

    Hiểu tính nguyên bản. Các tài liệu như bình luận pháp lý, bài giảng, hoặc cơ sở dữ liệu tổ chức (như danh mục sách thư viện) có thể được bảo vệ nếu có yếu tố sáng tạo. Chẳng hạn như các phân tích pháp lý từ Tòa án Nhân dân Tối cao hoặc các bài giảng từ Đại học Luật Hà Nội có thể có bản quyền.

    Sử dụng nguồn công cộng cẩn thận. Khi sử dụng dữ liệu từ Cổng thông tin điện tử Chính phủ hoặc Công báo, cần đảm bảo không sao chép các phần chú thích hoặc phân tích có bản quyền.

    Tạo dữ liệu độc lập. Các công ty nên đầu tư vào việc tổng hợp dữ liệu từ các nguồn công khai, như văn bản pháp luật hoặc án lệ, để tránh phụ thuộc vào dữ liệu có bản quyền.

    Thứ ba, đánh giá cẩn thận cơ sở pháp lý phù hợp

    Lập luận sử dụng hợp lý của Ross trong vụ việc nêu trên thất bại vì việc sử dụng dữ liệu là thương mại và cạnh tranh trực tiếp với Westlaw. Tại Việt Nam, Điều 25 Luật Sở hữu trí tuệ cho phép sử dụng hợp lý trong các trường hợp như nghiên cứu phi lợi nhuận hoặc trích dẫn hợp lý, nhưng các doanh nghiệp cũng nên hiểu giới hạn sử dụng hợp lý. Việc sử dụng dữ liệu có bản quyền để tạo sản phẩm thương mại, đặc biệt nếu cạnh tranh với chủ sở hữu, khó được coi là hợp lý. Ví dụ, một công ty AI Việt Nam sử dụng dữ liệu từ sách giáo khoa để tạo ứng dụng học tập cạnh tranh với nhà xuất bản có thể bị kiện. Bên cạnh việc tự đánh giá tính hợp lý khi sử dụng dữ liệu, các doanh nghiệp công nghệ nên tư vấn chuyên môn pháp lý từ các công ty luật, đặc biệt các công ty có thể mạnh về sở hữu trí tuệ để đánh giá xem việc sử dụng dữ liệu có rơi vào phạm vi sử dụng hợp lý hay không. Đồng thời, doanh nghiệp cũng nên tập trung vào tính biến đổi và khác biệt của dữ liệu mình tạo ra. Sản phẩm AI cần có mục đích hoặc chức năng khác biệt rõ rệt so với dữ liệu gốc để được coi là sử dụng hợp lý.

    Thứ tư, xây dựng quy trình quản lý dữ liệu minh bạch

    Ross đã không kiểm tra kỹ lưỡng nguồn gốc dữ liệu từ LegalEase, dẫn đến vi phạm. Kinh nghiệm này cho thấy, các công ty công nghệ của Việt Nam khi phát triển dữ liệu dựa trên AI cần phải:

    Kiểm tra nguồn gốc dữ liệu. Thiết lập quy trình kiểm tra tính hợp pháp của dữ liệu từ nhà cung cấp, bao gồm yêu cầu chứng minh quyền sở hữu hoặc giấy phép.

    Hợp đồng rõ ràng. Khi làm việc với bên thứ ba, cần có hợp đồng nêu rõ trách nhiệm pháp lý về dữ liệu và các quyền có liên quan. Ví dụ, nếu một công ty AI Việt Nam thuê bên thứ ba thu thập dữ liệu pháp lý, cần yêu cầu cam kết rằng dữ liệu không vi phạm bản quyền, không vi phạm quy định về thu thập dữ liệu cá nhân,...

    Lưu trữ hồ sơ. Việc doanh nghiệp ghi lại chi tiết về nguồn dữ liệu và cách sử dụng để làm bằng chứng trong trường hợp tranh chấp tiềm tàng việc sử dụng dữ liệu này có thể xảy ra giữa các bên liên quan trong tương lai là rất cần thiết.

    Thứ năm, doanh nghiệp nên đầu tư vào dữ liệu độc quyền và nghiên cứu phát triển

    Tòa án lưu ý rằng Ross có thể tự tạo dữ liệu tương tự headnotes mà không vi phạm bản quyền. Các công ty Việt Nam nên lưu ý trong việc tạo dữ liệu độc quyền. Việc đầu tư vào việc thu thập và phân tích dữ liệu từ các nguồn công khai, như văn bản pháp luật từ Công báo hoặc án lệ từ Tòa án Nhân dân Tối cao. Ngoài ra, việc tăng cường R&D, đầu tư vào nghiên cứu và phát triển để xây dựng cơ sở dữ liệu riêng, giảm phụ thuộc vào dữ liệu của bên thứ ba cũng là một cách hiệu quả để tránh các tranh chấp không đáng có trong lĩnh vực này.

    Vụ kiện Thomson Reuters v. Ross Intelligence là một lời cảnh báo cho các công ty công nghệ về rủi ro pháp lý khi sử dụng dữ liệu có bản quyền trong phát triển AI. Đối với Việt Nam, nơi ngành AI đang phát triển mạnh mẽ, các bài học từ vụ kiện này nhấn mạnh tầm quan trọng của việc tuân thủ pháp luật về sở hữu trí tuệ, xây dựng dữ liệu độc quyền, và quản lý rủi ro pháp lý. Bằng cách áp dụng những bài học này, các công ty công nghệ Việt Nam không chỉ có thể tránh được các tranh chấp tốn kém mà còn xây dựng được các sản phẩm AI bền vững, minh bạch, và cạnh tranh trên thị trường toàn cầu.