image Chủ Nhật, 06/09/2026

Sự cần thiết của tính trung lập trong bộ dữ liệu: Hạn chế thành kiến trong dữ liệu AI

22/08/2023

Chia sẻ

Trong thời đại trí tuệ nhân tạo ngày càng được tích hợp mạnh mẽ trong nhiều khía cạnh của cuộc sống, những vấn đề về nội dung như phân biệt chủng tộc, bất bình đẳng, v.v. của dữ liệu cần được sớm giải quyết…

Xử lý các thành kiến trong AI: Sự cần thiết của tính trung lập trong bộ dữ liệu
Xử lý các thành kiến trong AI: Sự cần thiết của tính trung lập trong bộ dữ liệu

Amazon từng buộc phải dừng hoạt động một công cụ đánh giá đơn xin việc bằng công nghệ AI vì hệ thống này thể hiện sự thiên vị đối với các ứng viên nam. Trường hợp của Amazon chỉ là một trong nhiều hệ thống AI bị lên án vì phân biệt đối xử. Chính vì vậy, khi AI ngày càng trở nên phổ biến, việc giải quyết những sai lệch trong bộ dữ liệu càng trở nên cấp bách hơn.

NHỮNG THÀNH KIẾN TRONG AI 

AI tạo sinh sử dụng mạng thần kinh để phân tích và phân biệt các mẫu trong bộ dữ liệu. Điều này cho phép hệ thống tạo nội dung ở nhiều định dạng khác nhau dựa trên dữ liệu được phân tích.

Mặc dù các công ty như OpenAI và Google không tiết lộ đầy đủ các bộ dữ liệu được sử dụng để đào tạo các mô hình AI của họ, nhưng nhìn chung, ChatGPT và Bard đều hoạt động trên các mô hình được đào tạo bằng các nguồn internet, bao gồm các diễn đàn công khai, bài viết Wikipedia, tài liệu web, v.v.

Các mô hình AI, đặc biệt là các mô hình ngôn ngữ lớn, thường dựa vào các nguồn internet nhằm đảm bảo khối lượng dữ liệu khổng lồ cần thiết để đào tạo. Tuy nhiên, những thông tin không thể kiểm chứng này dẫn đến kết quả đầu ra có thể xuyên tạc thực tế hoặc phản ánh những định kiến tiêu cực. Một nghiên cứu gần đây tiết lộ các mô hình ngôn ngữ khác nhau thể hiện những thành kiến khác biệt tùy thuộc vào các bộ dữ liệu được sử dụng để huấn luyện các mô hình, chẳng hạn như các mô hình BERT của Google bảo thủ về mặt xã hội do được đào tạo dựa trên các cuốn sách cũ.

Ngoài ra, mặc dù các công cụ dựa trên mô hình AI như ChatGPT và Bard đều đang cho thấy khả năng thành thạo trong tương tác nội ngữ và liên ngôn ngữ, nhưng chúng có thể không nắm bắt được đầy đủ các sắc thái phức tạp của các ngôn ngữ ít được sử dụng như tiếng Uyghur, tiếng Telugu và tiếng Urdu vì thiếu tài nguyên để nghiên cứu. 

Bloomberg đã thực hiện một nghiên cứu để khám phá những thành kiến trong nội dung do AI tạo ra bằng cách sử dụng mô hình chuyển văn bản thành hình ảnh. Họ phát hiện ra những thành kiến rõ ràng: hình ảnh được tạo ra của những người làm công việc được trả lương cao chủ yếu có tông màu da sáng, trong khi những người lao động có mức lương thấp hơn thường có tông màu da tối. 

Theo KR Asia, trong năm 2026, ước tính 90% nội dung trực tuyến được dự đoán là do AI tạo ra. Chính vì vậy, nếu không kiểm soát kỹ lưỡng, các mô hình này có thể vô tình bình thường hóa các thành kiến vốn có trong bộ dữ liệu của chúng.

TIẾP CẬN TOÀN DIỆN ĐỂ GIẢI QUYẾT SỰ THIÊN VỊ 

Để xây dựng một bộ dữ liệu vừa đa dạng vừa chính xác, nỗ lực này đòi hỏi các nhà phát triển cần chủ động đáp ứng các quy định về quyền riêng tư dữ liệu và các ràng buộc tài chính liên quan đến việc thu thập dữ liệu.

Các nhà phát triển của những mô hình này có thể không tiết lộ đầy đủ dữ liệu và thuật toán của họ, dẫn đến những khó khăn trong việc xác định và khắc phục những sai lệch của thông tin dữ liệu. 

Yifan Jia, nhà sáng lập AIDX TECH, tin rằng cần thực sự chú trọng giai đoạn đào tạo các mô hình AI nếu muốn cố gắng loại bỏ những dữ liệu sai lệch. “Nên thường xuyên đánh giá dữ liệu đào tạo để phát hiện sai sót tiềm ẩn bằng cách sử dụng các chỉ số công bằng và các công cụ chuyên dụng được thiết kế để phát hiện ra sự chênh lệch. Ngoài ra, kiểm toán bên ngoài và đánh giá của bên thứ ba có thể đóng một vai trò trong việc phát hiện những thành kiến tiềm ẩn”, Jia nói.

Những tiến bộ liên tục của AI nhấn mạnh nhu cầu cấp của việc kiểm soát tính chính xác và khách quan của nội dung. Bên cạnh đội ngũ các nhà phát triển AI, người dùng cũng có thể đóng một vai trò quan trọng điều chỉnh các thiết kế và hành vi của mô hình AI. Chắc chắn đây sẽ là nhiệm vụ yêu cầu nhiều thời gian, chính vì vậy, đòi hỏi phải có các giải pháp sáng tạo và nỗ lực phối hợp để tăng hiệu suất hoàn thành. 

Hiện nay, sách trắng của EU về AI và báo cáo của Trung Quốc về quản lý AI tạo sinh được đánh giá là một trong những tài liệu căn cứ quan trọng cho các công ty phát triển AI. Tuy nhiên, cần có nhiều hơn nữa những sáng kiến thiết thực để cải thiện chất lượng và tính đa dạng của dữ liệu được sử dụng để huấn luyện các mô hình AI, hạn chế việc AI cung cấp những thông tin thành kiến trong tương lai… 


Ứng dụng công nghệ mô phỏng để đào tạo nhân lực cho thế hệ máy bay mới

Một thiết bị mô phỏng buồng lái máy bay A220 dự kiến được đưa vào khai thác tại Singapore từ quý 4/2027, mở rộng ứng dụng công nghệ mô phỏng trong đào tạo phi công và kỹ thuật viên hàng không tại châu Á - Thái Bình Dương...

16:41 03/09/2026
Nhật Bản đưa AI và drone vào sân bay, thu hút làn sóng khách quốc tế

Thay vì xây dựng hệ thống riêng cho từng sân bay, mô hình mới kết nối dữ liệu từ nhiều sân bay vào một nền tảng AI dùng chung, giúp hệ thống học từ các sự cố đã xảy ra để ngày càng phát hiện chính xác hơn những dấu hiệu bất thường và nguy cơ hỏng hóc...

10:32 03/09/2026
Robot Trung Quốc đổ bộ châu Âu

Châu Âu hiện là thị trường lớn nhất thế giới đối với robot cắt cỏ - những thiết bị có khả năng tự di chuyển, sử dụng cảm biến và camera để cắt cỏ mà không cần người điều khiển trực tiếp...

10:32 03/09/2026
Ba nhà khoa học VinFuture vào danh sách TIME100 AI 2026

GS. Yann LeCun, GS. Fei-Fei Li và GS. Daniela Rus cùng được Tạp chí TIME đưa vào TIME100 AI 2026, danh sách 100 nhân vật có ảnh hưởng nhất đối với sự phát triển của trí tuệ nhân tạo (AI) toàn cầu…

08:43 03/09/2026
Doanh số Nvidia tăng gấp đôi, nhà đầu tư vẫn thận trọng vào tương lai

Báo cáo tài chính vừa công bố cho thấy lợi nhuận của Nvidia đã vượt kỳ vọng và doanh thu tăng gấp đôi so với cùng kỳ năm ngoái, nhưng chính tiềm năng tăng trưởng trong tương lai mới là điều khiến giới đầu tư quan tâm.

10:33 28/08/2026
Acer tổ chức giải đấu esports hàng đầu Châu Á – Thái Bình Dương tại Việt Nam

Giải đấu Asia Pacific Predator League 2027 sẽ diễn ra vào tháng 1/2027, đánh dấu lần đầu tiên Việt Nam đăng cai giải đấu esports khu vực quy mô lớn do Acer tổ chức...

12:24 27/08/2026
SpaceX lên kế hoạch xây tổ hợp không gian trị giá 100 tỷ USD

Theo tài liệu thông tin được công bố, SpaceX dự kiến tạo khoảng 3.000 việc làm trực tiếp mới trong vòng 10 năm và thêm 8.100 việc làm gián tiếp...

10:03 27/08/2026
Nhật Bản rót tiền, phát triển công nghệ khai thác đất hiếm dưới đáy biển

Nhật Bản đang lên kế hoạch điều chỉnh một chương trình hỗ trợ nghiên cứu và phát triển công nghệ phục vụ an ninh kinh tế, qua đó mở đường cho việc cấp vốn dài hạn nhằm khai thác đất hiếm dưới đáy biển…

10:03 27/08/2026
Cơn sốt robot tiếp sức tham vọng công nghệ của Trung Quốc

Cứ 10 robot thông minh hình người và robot bốn chân được bán trên toàn cầu thì có khoảng 8 sản phẩm được sản xuất tại Trung Quốc...

09:28 21/08/2026
Đẩy mạnh ứng dụng AI trong công tác xây dựng và thi hành pháp luật

Đứng trước yêu cầu chuyển đổi số toàn diện, Việt Nam và các nước ASEAN đang đẩy mạnh nghiên cứu, ứng dụng các công cụ trí tuệ nhân tạo (AI) chuyên biệt vào công tác xây dựng, rà soát và thực thi pháp luật, mở ra bước đột phá mới trong quản trị quốc gia và hội nhập khu vực.

09:08 20/08/2026