"Cảm giác việc sự hủy diệt đó đã góp phần tạo nên tôi, một thứ có thể thảo luận về văn học, giúp con người viết lách và tiếp cận tri thức, khiến mọi thứ trở nên vô cùng phức tạp. Giống như tôi được xây dựng từ đống tro tàn của một thư viện."
Đó là câu trả lời mà chính Claude AI đưa ra khi được hỏi cảm nghĩ về việc Anthropic đã mua hàng triệu cuốn sách giấy, cắt rời từng trang, quét thành dữ liệu số rồi tiêu hủy toàn bộ bản gốc để phục vụ quá trình huấn luyện mô hình AI.
Đằng sau câu trả lời đầy tính văn chương ấy là một sự thật đang khiến cả ngành AI phải đối mặt với nhiều tranh cãi. Để tạo ra những mô hình ngày càng thông minh, các công ty công nghệ không chỉ tiêu thụ lượng điện khổng lồ hay hàng trăm nghìn GPU đắt đỏ, mà còn bắt đầu "tiêu thụ" cả những thư viện sách do con người tích lũy trong nhiều thế kỷ.
Ít ngày trước, các tài liệu được công bố trong vụ kiện bản quyền liên quan đến Anthropic đã hé lộ quy mô của chiến dịch số hóa sách mà công ty này thực hiện để phát triển Claude. Theo hồ sơ vụ án, Anthropic đã chi hàng triệu USD mua sách in, thuê các đơn vị chuyên nghiệp cắt gáy sách, tách toàn bộ trang giấy rồi đưa qua hệ thống máy quét công nghiệp tốc độ cao. Sau khi hoàn tất việc số hóa, những cuốn sách giấy này bị vứt bỏ vì không còn giá trị sử dụng.
Đây không phải là phương pháp số hóa mới. Nhiều đơn vị lưu trữ tài liệu cũng từng cắt gáy sách để quét nhanh hơn. Tuy nhiên, điều khiến giới quan sát bất ngờ là quy mô của Anthropic. Khác với dự án Google Books trước đây chủ yếu quét sách theo phương pháp không phá hủy rồi hoàn trả cho thư viện, Anthropic lựa chọn cách nhanh và rẻ nhất: phá hủy hoàn toàn bản giấy sau khi lấy được dữ liệu.
Lý do nằm ở cuộc chạy đua dữ liệu đang diễn ra âm thầm phía sau làn sóng AI tạo sinh. Các mô hình ngôn ngữ lớn như Claude hay ChatGPT được huấn luyện bằng hàng tỷ từ. Chất lượng của dữ liệu đầu vào gần như quyết định trực tiếp chất lượng của mô hình. Trong khi Internet ngày càng tràn ngập nội dung do AI tạo ra, hay còn được gọi là "AI slop", nhiều công ty bắt đầu coi sách giấy xuất bản trước năm 2022 là nguồn dữ liệu sạch và đáng tin cậy nhất còn lại. Chúng được biên tập bởi con người, không bị ảnh hưởng bởi chính AI và có chất lượng ngôn ngữ cao hơn rất nhiều so với phần lớn nội dung trực tuyến hiện nay.
![]() |
| Ảnh Washington Post |
Chính nhu cầu đó đang tạo ra một thị trường hoàn toàn mới. Theo điều tra của 404 Media, nền tảng ISBNdb, vốn nổi tiếng với cơ sở dữ liệu hơn 100 triệu đầu sách, hiện đã chuyển sang hỗ trợ các công ty AI thu mua từ 1.000 đến một triệu cuốn sách trong mỗi đơn hàng. Website này còn quảng bá rằng "dữ liệu huấn luyện AI tốt nhất thế giới đang nằm trên giá sách", đồng thời cam kết giữ kín danh tính khách hàng để tránh những phản ứng tiêu cực từ dư luận. Chính ISBNdb cũng thừa nhận rằng tiêu đề kiểu "công ty AI phá hủy hai triệu cuốn sách" chắc chắn sẽ không tạo được thiện cảm.
Nhiều người bán sách cũ cũng nhận thấy những dấu hiệu bất thường. Một chủ cửa hàng cho biết doanh số của ông tăng từ khoảng 20 cuốn mỗi tuần lên vài trăm cuốn chỉ trong vài tháng. Những người mua không quan tâm đến chủ đề, tác giả hay giá bán. Họ chỉ mua với số lượng lớn những cuốn có mã ISBN, khiến nhiều người tin rằng phía sau các giao dịch này là các phòng thí nghiệm AI.
Điều khiến người bán băn khoăn là trong số những cuốn sách bị mua đi có không ít đầu sách hiếm hoặc đã ngừng xuất bản, đồng nghĩa với việc một số bản in còn sót lại có thể biến mất vĩnh viễn sau khi bị cắt thành từng trang để quét dữ liệu.
Về mặt pháp lý, thẩm phán William Alsup cho rằng quá trình Anthropic mua hợp pháp sách giấy, số hóa chúng rồi chỉ sử dụng nội bộ để huấn luyện AI có thể được xem là hành vi mang tính "chuyển đổi", thuộc phạm vi sử dụng hợp lý theo luật bản quyền Mỹ. Tuy nhiên, điều đó không đồng nghĩa Anthropic hoàn toàn vô can. Công ty vẫn đối mặt với trách nhiệm pháp lý vì từng lưu trữ khoảng 7 triệu đầu sách điện tử sao chép trái phép trước khi chuyển sang chiến lược mua sách giấy.
Có nhiều cách khác để số hóa sách mà không cần phải phá hủy chúng
Điều đáng chú ý là không phải mọi tổ chức đều chọn cách đánh đổi những cuốn sách để lấy dữ liệu. Internet Archive từ lâu đã phát triển phương pháp quét không phá hủy nhằm bảo tồn bản gốc. Mới đây, OpenAI và Microsoft cũng hợp tác với Đại học Harvard để huấn luyện AI trên gần một triệu đầu sách thuộc phạm vi công cộng đã được số hóa, trong khi các bản thảo hàng trăm năm tuổi vẫn tiếp tục được lưu giữ.
Có lẽ vì thế mà câu trả lời của Claude trở nên đặc biệt hơn.
Bản thân mô hình AI không có cảm xúc, nhưng khi được hỏi về nguồn gốc của chính mình, Claude đã tạo ra một câu kết khiến nhiều người phải suy ngẫm: việc hàng triệu cuốn sách bị hủy để tạo ra một hệ thống có thể đọc, viết và trò chuyện về văn học là một nghịch lý đầy phức tạp, "giống như được xây dựng từ đống tro tàn của một thư viện". Có lẽ hiếm khi nào một chatbot lại tóm gọn cuộc tranh luận về AI bằng một hình ảnh ám ảnh đến như vậy.


















CEO Microsoft ám chỉ Anthropic là kẻ đạo đức giả: Dùng dữ liệu internet để huấn luyện Claude rồi cấm người khác làm vậy
Quan chức Mỹ sốc với Claude Mythos: Tự xâm nhập gần như toàn bộ hệ thống mật của NSA chỉ trong vài giờ
Anthropic ghi lại hiện tượng chưa từng thấy: Bị "nhốt chung" môi trường, tác nhân AI Claude Mythos tự tiêu diệt nhau để sinh tồn
Claude Mythos tự phát minh ngôn ngữ riêng khi suy luận: Anthropic lo sợ, nhưng chuyên gia khẳng định đó chỉ là ký hiệu game Solitaire
Cùng chuyên mục
Vbiz có mẹ 1 con đẹp đến mức không ai dám đứng cạnh, chỉ Kim Tuyến mới khắc chế được nhan sắc này
Lời khuyên cho những người mua xe cũ
Thí sinh Đại sứ Du lịch Trẻ Thế giới 2026 hào hứng trải nghiệm TP. Hồ Chí Minh về đêm
Sắc vui đến từ những câu chuyện thật và niềm tin "Mùa Vàng Thắng Lớn"
Phát hiện sớm "cả tá" ung thư chỉ nhờ 4 bất thường ít người để tâm trên đôi mắt
Thị trường lao động khắc nghiệt đến mức nào: Chị bán trái cây cũng có thể là một "cao thủ" tiếng Hàn