image Thứ Tư, 18/03/2026

Sự cần thiết của tính trung lập trong bộ dữ liệu: Hạn chế thành kiến trong dữ liệu AI

22/08/2023

Chia sẻ

Trong thời đại trí tuệ nhân tạo ngày càng được tích hợp mạnh mẽ trong nhiều khía cạnh của cuộc sống, những vấn đề về nội dung như phân biệt chủng tộc, bất bình đẳng, v.v. của dữ liệu cần được sớm giải quyết…

Xử lý các thành kiến trong AI: Sự cần thiết của tính trung lập trong bộ dữ liệu
Xử lý các thành kiến trong AI: Sự cần thiết của tính trung lập trong bộ dữ liệu

Amazon từng buộc phải dừng hoạt động một công cụ đánh giá đơn xin việc bằng công nghệ AI vì hệ thống này thể hiện sự thiên vị đối với các ứng viên nam. Trường hợp của Amazon chỉ là một trong nhiều hệ thống AI bị lên án vì phân biệt đối xử. Chính vì vậy, khi AI ngày càng trở nên phổ biến, việc giải quyết những sai lệch trong bộ dữ liệu càng trở nên cấp bách hơn.

NHỮNG THÀNH KIẾN TRONG AI 

AI tạo sinh sử dụng mạng thần kinh để phân tích và phân biệt các mẫu trong bộ dữ liệu. Điều này cho phép hệ thống tạo nội dung ở nhiều định dạng khác nhau dựa trên dữ liệu được phân tích.

Mặc dù các công ty như OpenAI và Google không tiết lộ đầy đủ các bộ dữ liệu được sử dụng để đào tạo các mô hình AI của họ, nhưng nhìn chung, ChatGPT và Bard đều hoạt động trên các mô hình được đào tạo bằng các nguồn internet, bao gồm các diễn đàn công khai, bài viết Wikipedia, tài liệu web, v.v.

Các mô hình AI, đặc biệt là các mô hình ngôn ngữ lớn, thường dựa vào các nguồn internet nhằm đảm bảo khối lượng dữ liệu khổng lồ cần thiết để đào tạo. Tuy nhiên, những thông tin không thể kiểm chứng này dẫn đến kết quả đầu ra có thể xuyên tạc thực tế hoặc phản ánh những định kiến tiêu cực. Một nghiên cứu gần đây tiết lộ các mô hình ngôn ngữ khác nhau thể hiện những thành kiến khác biệt tùy thuộc vào các bộ dữ liệu được sử dụng để huấn luyện các mô hình, chẳng hạn như các mô hình BERT của Google bảo thủ về mặt xã hội do được đào tạo dựa trên các cuốn sách cũ.

Ngoài ra, mặc dù các công cụ dựa trên mô hình AI như ChatGPT và Bard đều đang cho thấy khả năng thành thạo trong tương tác nội ngữ và liên ngôn ngữ, nhưng chúng có thể không nắm bắt được đầy đủ các sắc thái phức tạp của các ngôn ngữ ít được sử dụng như tiếng Uyghur, tiếng Telugu và tiếng Urdu vì thiếu tài nguyên để nghiên cứu. 

Bloomberg đã thực hiện một nghiên cứu để khám phá những thành kiến trong nội dung do AI tạo ra bằng cách sử dụng mô hình chuyển văn bản thành hình ảnh. Họ phát hiện ra những thành kiến rõ ràng: hình ảnh được tạo ra của những người làm công việc được trả lương cao chủ yếu có tông màu da sáng, trong khi những người lao động có mức lương thấp hơn thường có tông màu da tối. 

Theo KR Asia, trong năm 2026, ước tính 90% nội dung trực tuyến được dự đoán là do AI tạo ra. Chính vì vậy, nếu không kiểm soát kỹ lưỡng, các mô hình này có thể vô tình bình thường hóa các thành kiến vốn có trong bộ dữ liệu của chúng.

TIẾP CẬN TOÀN DIỆN ĐỂ GIẢI QUYẾT SỰ THIÊN VỊ 

Để xây dựng một bộ dữ liệu vừa đa dạng vừa chính xác, nỗ lực này đòi hỏi các nhà phát triển cần chủ động đáp ứng các quy định về quyền riêng tư dữ liệu và các ràng buộc tài chính liên quan đến việc thu thập dữ liệu.

Các nhà phát triển của những mô hình này có thể không tiết lộ đầy đủ dữ liệu và thuật toán của họ, dẫn đến những khó khăn trong việc xác định và khắc phục những sai lệch của thông tin dữ liệu. 

Yifan Jia, nhà sáng lập AIDX TECH, tin rằng cần thực sự chú trọng giai đoạn đào tạo các mô hình AI nếu muốn cố gắng loại bỏ những dữ liệu sai lệch. “Nên thường xuyên đánh giá dữ liệu đào tạo để phát hiện sai sót tiềm ẩn bằng cách sử dụng các chỉ số công bằng và các công cụ chuyên dụng được thiết kế để phát hiện ra sự chênh lệch. Ngoài ra, kiểm toán bên ngoài và đánh giá của bên thứ ba có thể đóng một vai trò trong việc phát hiện những thành kiến tiềm ẩn”, Jia nói.

Những tiến bộ liên tục của AI nhấn mạnh nhu cầu cấp của việc kiểm soát tính chính xác và khách quan của nội dung. Bên cạnh đội ngũ các nhà phát triển AI, người dùng cũng có thể đóng một vai trò quan trọng điều chỉnh các thiết kế và hành vi của mô hình AI. Chắc chắn đây sẽ là nhiệm vụ yêu cầu nhiều thời gian, chính vì vậy, đòi hỏi phải có các giải pháp sáng tạo và nỗ lực phối hợp để tăng hiệu suất hoàn thành. 

Hiện nay, sách trắng của EU về AI và báo cáo của Trung Quốc về quản lý AI tạo sinh được đánh giá là một trong những tài liệu căn cứ quan trọng cho các công ty phát triển AI. Tuy nhiên, cần có nhiều hơn nữa những sáng kiến thiết thực để cải thiện chất lượng và tính đa dạng của dữ liệu được sử dụng để huấn luyện các mô hình AI, hạn chế việc AI cung cấp những thông tin thành kiến trong tương lai… 


Thị trường kính AI "cất cánh": Lượng hàng xuất xưởng tăng trưởng kỷ lục 322%

Sự gia tăng mạnh mẽ của kính AI được thúc đẩy bởi thị trường Trung Quốc, nơi hàng loạt sản phẩm mới ra mắt...

09:17 18/03/2026
Trung Quốc lần đầu phê duyệt thiết bị cấy ghép giao diện não – máy tính

Trung Quốc vừa ghi dấu mốc quan trọng trong lĩnh vực công nghệ thần kinh khi lần đầu tiên cấp phép thương mại thiết bị cấy ghép giao diện não – máy tính (BCI) nhằm giúp bệnh nhân chấn thương tủy sống phục hồi chức năng vận động bàn tay...

15:51 16/03/2026
Meta ra mắt hàng loạt chip AI riêng

Phó Chủ tịch Kỹ thuật Yee Jiun Song cho biết các chip này giúp Meta đa dạng hóa nguồn cung silicon và phần nào giảm tác động từ biến động giá…

14:03 14/03/2026
Nhật Bản muốn chiếm 1/3 thị phần bán dẫn toàn cầu

Nhật Bản đặt mục tiêu đạt hơn 250 tỷ USD doanh thu chip sản xuất trong nước vào năm 2040…

12:03 14/03/2026
Khám phá các tác nhân AI bên trong Microsoft 365 Copilot

Microsoft đang thử nghiệm Copilot Cowork – bước tiến mới của AI văn phòng, cho phép hệ thống không chỉ hỗ trợ viết nội dung mà còn tự thực hiện công việc trong phần mềm. Nếu thành công, AI có thể trở thành “đồng nghiệp số” thực sự trong môi trường doanh nghiệp…

11:58 14/03/2026
"UAV bầy đàn": Giải pháp ứng dụng AI, chữa cháy tại các hẻm nhỏ ở thành phố lớn

CT UAV, thành viên của CT Group, đã phát triển một giải pháp "UAV chữa cháy bầy đàn" đầu tiên tại Việt Nam dùng AI để điều khiển phi đội UAV tiếp cận nhanh, xử lý các đám cháy ở sâu trong ngõ nhỏ, hẻm sâu...

11:48 14/03/2026
Bên trong các phòng thí nghiệm AI chuyên huấn luyện robot hình người của Trung Quốc

Trung Quốc đang xây dựng hàng loạt trung tâm thu thập dữ liệu và “nông trại huấn luyện” robot nhằm tạo ra bộ dữ liệu khổng lồ để phát triển robot hình người…

13:48 13/03/2026
Nhà sản xuất Trung Quốc nuôi tham vọng về điện thoại robot?

Honor ra mắt chiếc điện thoại có cánh tay robot cùng với mẫu robot hình người tại Mobile World Congress 2026…

09:33 13/03/2026
Giải mã Moltbook, "sân chơi" mạng xã hội dành riêng cho bot đang gây sốt toàn cầu

Moltbook, một mạng xã hội nơi người dùng không phải con người mà là các tác nhân AI (AI agent) đang trở thành chủ đề nóng trong giới công nghệ...

09:31 13/03/2026
Trung Quốc phát triển transistor 1 nm nhỏ nhất thế giới, hứa hẹn định hình chip AI thế hệ mới

Các nhà nghiên cứu tại Đại học Bắc Kinh đã phát triển transistor ferroelectric có cổng chỉ 1 nanomet – nhỏ nhất và tiết kiệm năng lượng nhất hiện nay...

16:23 06/03/2026