Bên trong công nghệ giúp Siri, Alexa nói chuyện giống con người
HHạ Chi
Chọn cỡ chữ
Học máy, một nhánh của AI, đang được ứng dụng để giúp các thiết bị phát âm tự nhiên như giọng con người. Thông qua việc học từ rất nhiều bản ghi âm, các hệ thống hiện thậm chí có thể học cách một người lấy hơi, hoặc nhịp điệu lúc họ bật cười,...
Ảnh minh hoạ: Adobe Stock.
Khi con người nói, phổi đẩy không khí qua khí quản và dây thanh quản. Luồng khí làm dây thanh quản rung lên, tạo ra âm thanh. Sau đó, não điều khiển miệng, lưỡi và môi để định hình những âm thanh này thành các từ ngữ hoàn chỉnh.
Vậy làm thế nào để các trợ lý ảo như Siri hay Alexa trả lời bằng giọng nói ngày càng tự nhiên, gần giống cách con người nói chuyện? Ông Tâm Nguyễn, Phó giáo sư khoa học máy tính tại Đại học Dayton, trong bài viết trên The Conversation giải thích về cơ bản, máy tính mô phỏng quá trình tạo ra lời nói của con người bằng cách gửi các tín hiệu điện đến một chiếc loa nhỏ. Loa rung với tốc độ rất nhanh, làm không khí xung quanh rung theo và tạo thành sóng âm thanh.
Phần mềm trong máy tính điều khiển các tín hiệu điện này, qua đó điều chỉnh sóng âm thanh để tạo ra tiếng nói.
Nếu máy tính muốn nói một từ, phần mềm sẽ chia từ thành những đơn vị âm thanh nhỏ hơn, gọi là âm vị. Chẳng hạn, trong từ tiếng Anh “ship”, có thể nhận diện các âm “sh”, “i” và “p”. Phần mềm tạo ra từng âm vị rồi ghép chúng lại theo đúng thứ tự để hình thành từ và câu.
Từ những năm 1700, các nhà phát minh đã cố gắng mô phỏng hoạt động của phổi và cổ họng bằng cơ học. Họ sử dụng những ống thổi, túi lớn có thể bóp bằng tay, để đẩy không khí qua các đường ống, còi và ống bằng da. Dĩ nhiên, những âm thanh tạo ra từ cách làm này rất kỳ quặc, thậm chí có phần đáng sợ so với giọng nói của con người.
Ngày nay, học máy, một nhánh của AI, được ứng dụng để giúp các thiết bị phát âm tự nhiên như giọng con người. Các kỹ sư và nhà khoa học cung cấp cho hệ thống AI rất nhiều dữ liệu, trong đó có hàng giờ bản ghi âm giọng nói của người thật. Từ dữ liệu này, phần mềm học máy phân tích các đặc điểm và quy luật trong lời nói của con người.
Đến những năm 1930, những cỗ máy phát ra tiếng nói bằng điện tử đầu tiên bắt đầu xuất hiện.
Một trong những thiết bị nổi tiếng nhất là Voder, được giới thiệu tại Hội chợ Thế giới năm 1939 ở New York. Thiết bị này có hình dáng khá giống một cây đàn organ. Để Voder phát ra tiếng nói, người vận hành phải đồng thời sử dụng các nút điều khiển, phím bấm điện tử và bàn đạp chân để điều chỉnh luồng khí và tạo ra những câu nói đơn giản như “Chào buổi sáng!”.
Mặc dù đây là một bước tiến quan trọng, giọng nói do máy tạo ra vẫn chưa thể hoàn toàn giống tiếng nói tự nhiên của con người.
Đến những năm 1960, máy tính bắt đầu tạo ra lời nói bằng cách ghép các âm vị lại với nhau. Tuy nhiên, giọng nói tạo ra vẫn ngắt quãng và thiếu tự nhiên.
Các phần mềm cũ thường lấy những đoạn âm thanh rất nhỏ từ giọng nói đã được ghi âm sẵn rồi ghép lại với nhau. Mỗi âm thanh được biểu diễn dưới dạng một bản đồ âm thanh, hay còn gọi là phổ âm. Có thể hình dung phổ âm như một biểu đồ với những đỉnh và đáy, thể hiện cường độ của các thành phần âm thanh tại từng thời điểm.
Sau đó, chương trình ghép những bản đồ âm thanh này lại với nhau giống như ghép các mảnh của một bức tranh.
Phương pháp này giúp máy tính tạo ra lời nói khá rõ ràng và dễ hiểu. Tuy nhiên, khi các âm thanh nhỏ được ghép lại, sự chuyển tiếp giữa các từ thường không liền mạch. Đó cũng là lý do những giọng nói máy tính đầu tiên, dù có thể phát âm được từ ngữ, vẫn rất khác với cách con người thực sự trò chuyện.
Ngày nay, học máy, một nhánh của AI, được ứng dụng để giúp các thiết bị phát âm tự nhiên như giọng con người.
Theo đó, các kỹ sư và nhà khoa học cung cấp cho hệ thống AI rất nhiều dữ liệu, trong đó có hàng giờ bản ghi âm giọng nói của người thật. Từ dữ liệu này, phần mềm học máy phân tích các đặc điểm và quy luật trong lời nói của con người.
Không chỉ là cách phát âm từng từ, hệ thống còn có thể nhận diện rất nhiều chi tiết tinh tế như cách một người lấy hơi, lúc họ bật cười, cách nhịp nói thay đổi, hay việc giọng nói trở nên cao hơn khi họ phấn khích.
Công nghệ hiện nay thậm chí cho phép một hệ thống AI tiên tiến chỉ cần nghe vài giây giọng nói của một người là có thể phân tích những đặc điểm riêng trong cách họ nói và tạo ra một bản sao giọng nói tương tự. Sau đó, hệ thống có thể dùng giọng nói này để đọc những câu mà người đó chưa từng nói.
Công nghệ chuyển văn bản thành giọng nói đang hỗ trợ hàng triệu người mỗi ngày.
Trong ô tô, công nghệ này có thể đọc chỉ đường, giúp người lái tập trung quan sát đường thay vì phải nhìn vào màn hình. Công nghệ này cũng có thể giúp đọc các bài báo, trang web và những nội dung khác cho người khiếm thị.
Tuy nhiên, cũng như nhiều công nghệ khác, công nghệ giọng nói có thể bị lợi dụng cho những mục đích xấu. Các hệ thống hiện nay đã có khả năng tạo ra giọng nói giả với độ chân thực cao, thường được gọi là âm thanh deepfake. Chỉ từ một đoạn ghi âm ngắn, AI có thể phân tích đặc điểm giọng nói của một người và tạo ra giọng tổng hợp rất giống giọng thật, làm gia tăng nguy cơ công nghệ này bị sử dụng để giả mạo, lừa đảo.
Do đó, các nhà khoa học và kỹ sư đang phát triển những công cụ có khả năng phân biệt giọng nói do AI tạo ra với giọng nói của con người, để hỗ trợ phát hiện sớm các nội dung giả mạo và hạn chế các vụ lừa đảo bằng giọng nói.
Nghị định số 147/2024/NĐ-CP quản lý, cung cấp, sử dụng dịch vụ Internet và thông tin trên mạng sau một thời gian áp dụng đã bộc lộ không ít bất cập, gây vướng mắc cho công tác quản lý. Trước thực trạng này, Bộ Văn hóa, Thể thao và Du lịch đang chủ trì sửa đổi quy định, trong đó trọng tâm là hoàn thiện cơ chế pháp lý riêng biệt đối với các dòng game phục vụ thi đấu thể thao điện tử (esports)...
Ngày càng nhiều các công ty công nghệ Trung Quốc tập trung vào những "điểm nghẽn" mà Bắc Kinh xác định cần nhanh chóng làm chủ để giảm phụ thuộc từ nước ngoài, đặc biệt trong chuỗi cung ứng bán dẫn…
Trung Quốc đang tận dụng lợi thế về quy mô sản xuất và chuỗi cung ứng để mở rộng nhanh ứng dụng robot công nghiệp, thách thức các đối thủ toàn cầu. Trong khi robot hình người thu hút sự chú ý, cuộc cách mạng robot thực sự đang diễn ra âm thầm trong các nhà máy, kho hàng, bệnh viện và cảng biển…
Tracxn đánh giá TP. Hồ Chí Minh, nơi đặt trụ sở của khoảng 120 công ty hoạt động trong lĩnh vực blockchain, hiện là trung tâm quan trọng trong lĩnh vực này tại khu vực Đông Nam Á...
Để thực hiện Nghị quyết số 19-NQ/TW, cũng trong ngày 28/7/2026 Bộ Chính trị đã ký ban hành Chương trình hành động thực hiện Nghị quyết với 40 chỉ tiêu và 51 nhiệm vụ, giải pháp cụ thể.
Sau kỳ nghỉ lễ Quốc khánh 2/9, Chính phủ đã tổ chức phiên họp thường kỳ tháng 8/2026, đánh giá tình hình kinh tế - xã hội 8 tháng đầu năm và xác định những nhiệm vụ trọng tâm cho chặng đường còn lại của năm.
Ngày 2/9/1945 đã mở ra bước ngoặt vĩ đại trong lịch sử dân tộc Việt Nam. Sự ra đời của nước Việt Nam Dân chủ Cộng hòa không chỉ khẳng định quyền độc lập, tự do và tự quyết về chính trị, mà còn trao...
VnEconomy cập nhật giá vàng trong nước & thế giới hôm nay: SJC, 9999, giá vàng USD/oz, biến động giá vàng tăng, giảm - phân tích, dự báo & dữ liệu lịch sử.
Nhìn lại di sản và thành tựu của Thời báo Kinh tế Việt Nam - Tạp chí Kinh tế Việt Nam trong 35 năm qua, giá trị lớn nhất không chỉ đo bằng lượng thông tin phục vụ bạn đọc hàng ngày, hàng giờ, cũng...
Interactive là một sản phẩm báo chí mới của VnEconomy vừa được ra mắt bạn đọc từ đầu tháng 3/2023 đã gây ấn tượng mạnh với độc giả bởi sự mới lạ, độc đáo. Đây cũng là sản phẩm độc quyền chỉ có trên...