image Chủ Nhật, 16/08/2026

Sự cần thiết của tính trung lập trong bộ dữ liệu: Hạn chế thành kiến trong dữ liệu AI

22/08/2023

Chia sẻ

Trong thời đại trí tuệ nhân tạo ngày càng được tích hợp mạnh mẽ trong nhiều khía cạnh của cuộc sống, những vấn đề về nội dung như phân biệt chủng tộc, bất bình đẳng, v.v. của dữ liệu cần được sớm giải quyết…

Xử lý các thành kiến trong AI: Sự cần thiết của tính trung lập trong bộ dữ liệu
Xử lý các thành kiến trong AI: Sự cần thiết của tính trung lập trong bộ dữ liệu

Amazon từng buộc phải dừng hoạt động một công cụ đánh giá đơn xin việc bằng công nghệ AI vì hệ thống này thể hiện sự thiên vị đối với các ứng viên nam. Trường hợp của Amazon chỉ là một trong nhiều hệ thống AI bị lên án vì phân biệt đối xử. Chính vì vậy, khi AI ngày càng trở nên phổ biến, việc giải quyết những sai lệch trong bộ dữ liệu càng trở nên cấp bách hơn.

NHỮNG THÀNH KIẾN TRONG AI 

AI tạo sinh sử dụng mạng thần kinh để phân tích và phân biệt các mẫu trong bộ dữ liệu. Điều này cho phép hệ thống tạo nội dung ở nhiều định dạng khác nhau dựa trên dữ liệu được phân tích.

Mặc dù các công ty như OpenAI và Google không tiết lộ đầy đủ các bộ dữ liệu được sử dụng để đào tạo các mô hình AI của họ, nhưng nhìn chung, ChatGPT và Bard đều hoạt động trên các mô hình được đào tạo bằng các nguồn internet, bao gồm các diễn đàn công khai, bài viết Wikipedia, tài liệu web, v.v.

Các mô hình AI, đặc biệt là các mô hình ngôn ngữ lớn, thường dựa vào các nguồn internet nhằm đảm bảo khối lượng dữ liệu khổng lồ cần thiết để đào tạo. Tuy nhiên, những thông tin không thể kiểm chứng này dẫn đến kết quả đầu ra có thể xuyên tạc thực tế hoặc phản ánh những định kiến tiêu cực. Một nghiên cứu gần đây tiết lộ các mô hình ngôn ngữ khác nhau thể hiện những thành kiến khác biệt tùy thuộc vào các bộ dữ liệu được sử dụng để huấn luyện các mô hình, chẳng hạn như các mô hình BERT của Google bảo thủ về mặt xã hội do được đào tạo dựa trên các cuốn sách cũ.

Ngoài ra, mặc dù các công cụ dựa trên mô hình AI như ChatGPT và Bard đều đang cho thấy khả năng thành thạo trong tương tác nội ngữ và liên ngôn ngữ, nhưng chúng có thể không nắm bắt được đầy đủ các sắc thái phức tạp của các ngôn ngữ ít được sử dụng như tiếng Uyghur, tiếng Telugu và tiếng Urdu vì thiếu tài nguyên để nghiên cứu. 

Bloomberg đã thực hiện một nghiên cứu để khám phá những thành kiến trong nội dung do AI tạo ra bằng cách sử dụng mô hình chuyển văn bản thành hình ảnh. Họ phát hiện ra những thành kiến rõ ràng: hình ảnh được tạo ra của những người làm công việc được trả lương cao chủ yếu có tông màu da sáng, trong khi những người lao động có mức lương thấp hơn thường có tông màu da tối. 

Theo KR Asia, trong năm 2026, ước tính 90% nội dung trực tuyến được dự đoán là do AI tạo ra. Chính vì vậy, nếu không kiểm soát kỹ lưỡng, các mô hình này có thể vô tình bình thường hóa các thành kiến vốn có trong bộ dữ liệu của chúng.

TIẾP CẬN TOÀN DIỆN ĐỂ GIẢI QUYẾT SỰ THIÊN VỊ 

Để xây dựng một bộ dữ liệu vừa đa dạng vừa chính xác, nỗ lực này đòi hỏi các nhà phát triển cần chủ động đáp ứng các quy định về quyền riêng tư dữ liệu và các ràng buộc tài chính liên quan đến việc thu thập dữ liệu.

Các nhà phát triển của những mô hình này có thể không tiết lộ đầy đủ dữ liệu và thuật toán của họ, dẫn đến những khó khăn trong việc xác định và khắc phục những sai lệch của thông tin dữ liệu. 

Yifan Jia, nhà sáng lập AIDX TECH, tin rằng cần thực sự chú trọng giai đoạn đào tạo các mô hình AI nếu muốn cố gắng loại bỏ những dữ liệu sai lệch. “Nên thường xuyên đánh giá dữ liệu đào tạo để phát hiện sai sót tiềm ẩn bằng cách sử dụng các chỉ số công bằng và các công cụ chuyên dụng được thiết kế để phát hiện ra sự chênh lệch. Ngoài ra, kiểm toán bên ngoài và đánh giá của bên thứ ba có thể đóng một vai trò trong việc phát hiện những thành kiến tiềm ẩn”, Jia nói.

Những tiến bộ liên tục của AI nhấn mạnh nhu cầu cấp của việc kiểm soát tính chính xác và khách quan của nội dung. Bên cạnh đội ngũ các nhà phát triển AI, người dùng cũng có thể đóng một vai trò quan trọng điều chỉnh các thiết kế và hành vi của mô hình AI. Chắc chắn đây sẽ là nhiệm vụ yêu cầu nhiều thời gian, chính vì vậy, đòi hỏi phải có các giải pháp sáng tạo và nỗ lực phối hợp để tăng hiệu suất hoàn thành. 

Hiện nay, sách trắng của EU về AI và báo cáo của Trung Quốc về quản lý AI tạo sinh được đánh giá là một trong những tài liệu căn cứ quan trọng cho các công ty phát triển AI. Tuy nhiên, cần có nhiều hơn nữa những sáng kiến thiết thực để cải thiện chất lượng và tính đa dạng của dữ liệu được sử dụng để huấn luyện các mô hình AI, hạn chế việc AI cung cấp những thông tin thành kiến trong tương lai… 


Nvidia công bố mô hình AI mã nguồn mở đầu tiên

Nvidia vừa công bố Nemotron 3.5 Lightning, mô hình AI mã nguồn mở mới được thiết kế theo hướng nhẹ, có thể vận hành trên một GPU máy tính cá nhân...

15:23 14/08/2026
Trẻ em Trung Quốc học thêm cùng "gia sư AI"

Với "gia sư AI", trẻ có thể tự học trong suốt kỳ nghỉ hè, không cần phụ huynh phải liên tục ngồi bên cạnh...

13:48 12/08/2026
Tập đoàn công nghệ Nhật Bản lập phòng ban chỉ có “nhân viên AI”, không có con người

Các tác nhân AI sẽ trải qua nhiều bước trong quá trình xử lý công việc, bao gồm cả những cuộc họp tương tự cuộc họp của đội ngũ quản lý cấp cao…

13:48 12/08/2026
Nvidia hợp tác với các "ông lớn" Phố Wall huy động 500 tỷ USD phát triển hạ tầng AI

Sáng kiến này nhằm mục đích mở rộng khả năng tiếp cận hạ tầng sử dụng công nghệ Nvidia cho các nhà phát triển AI tiên phong, doanh nghiệp, chính phủ và nhà cung cấp dịch vụ đám mây.

13:41 11/08/2026
Từ cuộc thi robot đến hệ sinh thái STEM: Bệ phóng cho nhân lực công nghệ Việt Nam

Bên cạnh học sinh, cuộc thi ROBOTACON® WRO® 2026 còn hướng đến việc xây dựng mạng lưới giáo viên STEM, câu lạc bộ robotics, cơ sở dữ liệu đội thi và phát triển các trung tâm trải nghiệm khoa học...

16:27 07/08/2026
Hãng công nghệ Trung Quốc Tencent đang chuyển từ “mô hình AI” sang “hệ sinh thái AI”

Thay vì chỉ cung cấp một công cụ hỏi - đáp như các chatbot AI giai đoạn đầu, Tencent đang hướng tới việc biến AI thành một "trợ lý số" có thể tham gia trực tiếp vào công việc hằng ngày của cá nhân và doanh nghiệp...

11:56 07/08/2026
Việt Nam thu hút sự quan tâm ngày càng lớn của các nhà vận hành hyperscale

Làn sóng đầu tư vào AI và trung tâm dữ liệu quy mô cực lớn (hyperscale) đang dịch chuyển mạnh sang các thị trường mới nổi, đưa Việt Nam trở thành điểm đến và thu hút sự quan tâm ngày càng lớn từ các nhà vận hành hạ tầng số.

16:30 06/08/2026
Bộ Xây dựng bồi dưỡng kiến thức AI, thúc đẩy chuyển đổi AI trong quản lý nhà nước

Với quy mô lớn, chương trình được tổ chức theo hình thức kết hợp trực tiếp và trực tuyến, kết nối gần 50 điểm cầu của Bộ Xây dựng, thu hút hơn 1.000 học viên tham gia.

18:41 04/08/2026
AI, IoT và truy xuất nguồn gốc: “Combo công nghệ mới” của nông nghiệp

Từ hệ thống tưới châm phân sinh học tích hợp AI, cảm biến giám sát sức khỏe đất đến truy xuất nguồn gốc bằng mã QR động, nhiều bạn trẻ Đồng bằng sông Cửu Long đang thử nghiệm công nghệ mới, giải quyết những bài toán cụ thể của sản xuất nông nghiệp...

10:04 03/08/2026
Hơn 1/3 website mới được tạo bởi AI, "thuyết Internet chết" dần thành hiện thực?

"Dead Internet Theory" cho rằng Internet, vốn từng là không gian do con người tạo lập và vận hành, đang dần bị lấn át bởi các bot và nội dung tự động...

15:21 02/08/2026