CyberAgent Co, Ltd (Trụ sở chính: Shibuya-ku, Tokyo, Giám đốc đại diện: Susumu Fujita, TSE Prime Market: Mã chứng khoán: 4751) là công ty được thành lập bởi Katsuhiko Yamamoto và Masato Murata, các nhà nghiên cứu thuộc tổ chức nghiên cứu và phát triển công nghệ trí tuệ nhân tạo “AI Lab” và ông Shao Xiang, người tham gia thực tập nghiên cứu “AI Lab”)※1, anh Hà Gia Quân※2, ông Hu Qinghong※3Sáu bài báo của et al sẽ được trình bày tại INTERSPEECH 2025, một hội nghị quốc tế về lĩnh vực xử lý ngôn ngữ nói※4Đây là năm thứ hai liên tiếp AI Lab có bài báo được chấp nhận tại phiên họp toàn thể
``INTERSPEECH'' là hội nghị quốc tế lớn nhất thế giới kèo tỷ lệ nhà cái lĩnh vực xử lý ngôn ngữ nói, được tài trợ bởi Hiệp hội Truyền thông Lời nói Quốc tế (ISCA) và năm nay đánh dấu lần thứ 26 nó được tổ chức Bài báo được chấp nhận dự kiến sẽ được trình bày tại INTERSPEECH 2025, được tổ chức tại Rotterdam, Hà Lan, vào tháng 8 năm 2025
■Nền
kèo tỷ lệ nhà cái những năm gần đây, với sự phát triển của công nghệ máy học, việc sản xuất các quảng cáo mới và tiếp thị kỹ thuật số sử dụng công nghệ AI đã thu hút sự chú ý Tại Phòng thí nghiệm AI, chúng tôi đang mở rộng phạm vi các lĩnh vực nghiên cứu cũng như nghiên cứu và phát triển công nghệ AI để giải quyết các vấn đề kỹ thuật khác nhau kèo tỷ lệ nhà cái các lĩnh vực này
Nhóm Âm thanh của AI Lab tiến hành nghiên cứu kèo tỷ lệ nhà cái lĩnh vực giọng nói và âm học, đang nghiên cứu để hiện thực hóa cuộc hội thoại bằng giọng nói tự nhiên và nâng cao, chẳng hạn như giọng nói song sinh kỹ thuật số của những người nổi tiếng, quảng cáo bằng giọng nói và ứng dụng cho bot giọng nói của trung tâm cuộc gọiSáu bài báo được chấp nhận lần này dự kiến sẽ được sử dụng kèo tỷ lệ nhà cái các quảng cáo và dịch vụ sử dụng giọng nói do những cải tiến về công nghệ như nhận dạng giọng nói, tổng hợp giọng nói và các chỉ báo đánh giá tự động
■Tóm tắt bài viết
“Đầu tiên phân tích sau đó nâng cao: Hệ thống nhận biết nhiệm vụ để tách, khử nhiễu và loại bỏ tiếng nói”Tác giả: Shao Xiang Dang (Đại học Nagoya), Li Li, Xianggo Seki (Phòng thí nghiệm AI của CyberAgent), Hiroaki Kudo (Đại học Nagoya)
| kèo tỷ lệ nhà cái nghiên cứu này, chúng tôi đã đề xuất một khung mới có thể kết hợp linh hoạt nhiều kỹ thuật nâng cao giọng nói khác nhau như loại bỏ tiếng ồn, giảm âm vang và tách loa để hỗ trợ nhiều phương pháp nâng cao dữ liệu âm thanh tùy thuộc vào môi trường và mục đích ghiPhương pháp được đề xuất bao gồm một bộ phân tích xác định loại điểm nhấn cần thiết cho giọng nói đầu vào và một nhóm mô-đun nhấn mạnh thực hiện từng quy trình nhấn mạnh Điều này giúp chỉ có thể áp dụng quy trình xử lý nâng cao cần thiết tương ứng với kết quả phân tích đối với dữ liệu âm thanh đầu vào
Với cách tiếp cận này,Cải thiện hiệu suất nâng cao giọng nói so với mô hình hợp nhất thông thườngTôi đã làm vậy Hơn nữa, vì có các mô-đun độc lập chuyên biệt cho từng nhiệm vụ nâng cao nên bạn có thể tự do kết hợp các mô-đun này cho phù hợp với nhu cầu của mình và mong muốn đạt được khả năng cải thiện giọng nói tối ưu |
「」Tác giả: Katsuhiko Yamamoto, Koichi Miyazaki (Phòng thí nghiệm AI của CyberAgent)
| Đạt được hiệu suất dự đoán tương đương hoặc tốt hơn với ít thông số hơn so với mẫu Máy biến áp thông thườngTôi đã làm vậy |
「」Tác giả: Masato Murata, Koichi Miyazaki, Tomoki Koriyama (Phòng thí nghiệm AI của CyberAgent)
| Để kiểm soát cường độ cảm xúc của nhiều người nói, giúp tạo ra giọng nói cảm xúc có nhiều cường độ khác nhau mà không cần giọng nói cảm xúc của người nói mục tiêu, các phương pháp dựa trên vectơ nhiệm vụ thông thường dựa vào biểu hiện cảm xúc của một người nói, điều này gây ra vấn đề mất tính nhất quán của người nói khi áp dụng cho các người nói khác nhaukèo tỷ lệ nhà cái nghiên cứu này, chúng tôi đã phát triển một phương pháp mới để trích xuất các vectơ cảm xúc độc lập với người nói, tức là những biểu hiện cảm xúc phổ biến có thể áp dụng cho bất kỳ người nói nào, từ một mô hình được đào tạo về giọng nói cảm xúc của nhiều người nói Điều này dẫn đếnNhận ra một phương pháp có thể kiểm soát cường độ cảm xúc kèo tỷ lệ nhà cái khi vẫn duy trì tính nhất quán của người nói bằng cách chỉ sử dụng giọng tham chiếu đọc của người nói không xác địnhTôi đã làm vậy |
「」Tác giả: Masato Murata, Koichi Miyazaki, Tomoki Koriyama (CyberAgent AI Lab), Tomoki Toda (Đại học Nagoya)
| Với công nghệ ``tạo loa'' tạo ra giọng nói của con người không tồn tại kèo tỷ lệ nhà cái dữ liệu đào tạo mà không có giọng nói tham chiếu, thách thức lớn nhất là làm thế nào để xác định ``không gian loa'' có thể tạo ra giọng nói ổn định với nhiều đặc điểm khác nhaukèo tỷ lệ nhà cái nghiên cứu này, chúng tôi đã đề xuất một phương pháp mới để xác định không gian loa nhằm tạo ra nhiều giọng nói khác nhau bằng cách sử dụng sự khác biệt về thông số giữa nhiều mẫu loa cơ bản và các mẫu được đào tạo trước
Chỉ cần chọn thông số mẫu mới từ không gian loa này, chúng tôi đã thành công kèo tỷ lệ nhà cái việc tạo ra nhiều loại giọng nói khác nhau Hơn nữa, chúng tôi phát hiện ra rằng có những hướng dẫn kèo tỷ lệ nhà cái không gian này cho phép chúng tôi kiểm soát các thuộc tính của giọng nói như giới tính, cho phép chúng tôiThay vì chỉ tạo giọng nói mới, giờ đây bạn có thể chủ ý điều chỉnh các đặc điểm của giọng nói, chẳng hạn như giới tính |
「」Tác giả: He Jiajun (Đại học Nagoya), Naoki Sawada, Koichi Miyazaki (Phòng thí nghiệm AI của CyberAgent), Tomoki Toda (Đại học Nagoya)
| Công nghệ nhận dạng giọng nói gặp vấn đề ở chỗ khó nhận ra những từ không xuất hiện thường xuyên kèo tỷ lệ nhà cái dữ liệu huấn luyện (từ có tần suất thấp) và hiệu suất nhận dạng giảm sút, đặc biệt là kèo tỷ lệ nhà cái dữ liệu giọng nói bao gồm các thuật ngữ kỹ thuật Hơn nữa, công nghệ thông thường khó có thể nhận ra những giọng nói chồng chéo được nói cùng lúc bởi nhiều người nói
kèo tỷ lệ nhà cái nghiên cứu này, chúng tôi đã đề xuất một khung tích hợp có thể giải quyết đồng thời hai vấn đề này Cụ thể, bằng cách đưa ra danh sách các từ có tần số thấp làm đầu vào kèo tỷ lệ nhà cái quá trình nhận dạng và sử dụng mô hình ngôn ngữ quy mô lớn (LLM),Đã phát triển hệ thống có thể nhận dạng các từ có tần số thấp với độ chính xác cao ngay cả khi giọng nói chồng chéo của nhiều người nóiTôi đã làm vậy Ngoài ra, vì việc sử dụng một danh sách lớn các từ có tần số thấp sẽ có tác động tiêu cực đến độ chính xác của nhận dạng giọng nói nên chúng tôi đã áp dụng phương pháp lọc hai bước để trích xuất và chỉ sử dụng hiệu quả những từ có liên quan nhiều đến giọng nói nhất định
Kết quả của các thử nghiệm là chúng tôi đã đạt được sự cải thiện hiệu suất đáng kể so với các phương pháp thông thường |
「」Tác giả: Hu Qinghong (Đại học Nagoya), Yusuke Yasuda (Viện Tin học Quốc gia/Đại học Nagoya), Akifumi Yoshimoto (Phòng thí nghiệm CyberAgent AI), Tomoki Toda (Đại học Nagoya)
| Nghiên cứu này đề xuất một kỹ thuật mới nhằm loại bỏ sai lệch do đánh giá của con người kèo tỷ lệ nhà cái đánh giá chất lượng giọng nói (SQA) và nhận dạng cảm xúc lời nói liên tục (CSER) Những đánh giá thông thường mang tính chủ quan của từng người đánh giá, dẫn đến kết quả có sự khác biệt Chúng tôi đã giải quyết vấn đề này bằng cách sử dụng "điểm so sánh" giữa các giọng nói và lập mô hình "thang đánh giá thống nhất" chung cho tất cả người đánh giá Theo kết quả thử nghiệm, phương pháp mới này làXác nhận rằng độ chính xác của dự đoán đã được cải thiện kèo tỷ lệ nhà cái cả nhiệm vụ SQA và CSERTôi đã làm vậy
Tính năng này dự kiến sẽ được sử dụng kèo tỷ lệ nhà cái nhiều lĩnh vực xử lý giọng nói, chẳng hạn như cải thiện dịch vụ khách hàng thông qua phân tích cảm xúc tại trung tâm cuộc gọi và tạo ra giọng nói giàu cảm xúc |
■Tương lai
Các công nghệ như nhận dạng giọng nói, tổng hợp giọng nói và chỉ báo đánh giá tự động được phát triển thông qua các nghiên cứu này dự kiến sẽ được sử dụng ở nhiều doanh nghiệp khác nhau, chẳng hạn như quảng cáo video dựa trên giọng nói, trợ lý giọng nói và tự động hóa trung tâm cuộc gọiAI Lab sẽ tiếp tục kết hợp công nghệ AI vào các sản phẩm để giải quyết các vấn đề kinh doanh và xã hội, đồng thời sẽ tiếp tục nỗ lực nghiên cứu và phát triển để đóng góp vào sự phát triển công nghệ và học thuật
※1 Liên kết với Đại học Nagoya Đã tham gia thực tập nghiên cứu từ ngày 2024/11/06※2 Liên kết với Đại học Nagoya Đã tham gia thực tập nghiên cứu từ ngày 01/08/2024※3 Liên kết với Đại học Nagoya Tham gia thực tập nghiên cứu từ ngày 07/08/2024
※4