OpenAI dùng bot thu thập dữ liệu Internet

OpenAI triển khai GPTbot để tự động thu thập dữ liệu từ các trang web toàn cầu, nhưng bị lo ngại sẽ trở thành công cụ phá hoại Internet.

OpenAI, nhà phát triển ChatGPT, ngày 8/8 xác nhận sự tồn tại của GPTbot - trình thu thập dữ liệu web để huấn luyện AI. Mô hình GPT-5 dự kiến được đào tạo bằng nguồn dữ liệu này.

"Việc cho phép GPTBot truy cập website của bạn giúp các mô hình AI trở nên chính xác hơn, đồng thời cải thiện khả năng và độ an toàn của chúng", OpenAI cho biết.

Trước đó, người dùng đã quen với Googlebot, có nhiệm vụ lọc thông tin, ưu tiên hiển thị và xếp hạng trang web trong các kết quả tìm kiếm. Dù cũng thu thập dữ liệu, Business Insider đánh giá Goolgebot hữu ích vì website có thêm lưu lượng truy cập nếu được đề xuất. Tuy nhiên, sự trỗi dậy của AI tạo sinh và mô hình ngôn ngữ lớn đang phá vỡ sự cộng tác này.

Các công cụ như GPTbot sẽ giúp ChatGPT và GPT-4 có thể tổng hợp và trả lời câu hỏi, người dùng không cần truy cập các đường link. Điều này khiến nhiều trang web mất lượng truy cập lớn. Có nghĩa, các nhà sáng tạo nội dung cung cấp dữ liệu để GPTbot thu thập và phát triển lớn mạnh, sau đó quay lại cạnh tranh với chính họ. Stack Overflow, web cộng đồng của những lập trình viên chuyên nghiệp, ghi nhận sụt giảm người tham gia khi ChatGPT đủ khả năng giải quyết các lỗi lập trình khó.

Giao diện ChatGPT. Ảnh: Bảo Lâm — Giao diện ChatGPT. Ảnh: *Bảo Lâm*

Theo Business Insider, nỗi lo về GPTbot đang lan truyền mạnh. Trang công nghệ The Verge đã triển khai việc chặn GPTbot. OpenAI cũng cho biết người dùng có thể lựa chọn không cho phép GPTbot thu thập thông tin.

"Sau khi lấy tất cả nội dung có bản quyền trên mạng để xây dựng một sản phẩm độc quyền, OpenAI giờ lại cung cấp cho mọi người cách để ngăn chặn", Prasad Dhumal, chuyên gia tư vấn về công cụ tìm kiếm, bình luận.

Neil Clarke, biên tập viên của Clarkesworld, cho rằng các nhà sáng tạo nội dung đang ngày càng mất niềm tin vào OpenAI. Bên cạnh GPTbot, một số công cụ khác như CCbot của Common Crawl cũng chuyên thu thập dữ liệu nhằm huấn luyện AI. Theo Clarke, CCbot thường xuyên tiến hành sao lưu dữ liệu đã lấy. Do đó, ngay cả khi ngăn không cho bot tiếp tục truy cập, chủ sở hữu website cũng không thể thu hồi dữ liệu cũ.

"Tôi không biết có ai từng thành công khi yêu cầu Common Crawl xóa các nội dung lấy từ trang web hay chưa. Tôi đã thử liên hệ nhưng họ không phản hồi", ông nói.

Trong khi đó, OpenAI cho biết GPTbot được lập trình để tránh nguồn nội dung có tính phí và thông tin cá nhân. Vào tháng 7, công ty đạt thỏa thuận với hãng thông tấn AP để mua quyền thu thập nội dung báo chí.

Dù vậy, OpenAI được cho là phải trả phí trước khi lấy nội dung của bên khác. "OpenAI cần làm việc với các nhà lập pháp về vấn đề thu thập dữ liệu trong quá khứ, hiện tại và tương lai", Clarke nói. Ngoài ra, ông cho rằng OpenAI không được phép đẩy trách nhiệm chặn GPTbot cho người dùng, mà họ nên xin phép để công cụ được tiếp cận một trang web nhất định.

Hoàng Giang

Trở lại Khoa học công nghệTrở lại Khoa học công nghệ