CyberAgent Co, Ltd (Trụ sở chính: Shibuya-ku, Tokyo, Chủ tịch: Takahiro Yamauchi, TSE Prime Market: Mã chứng khoán 4751) là người tham gia thực tập nghiên cứu tại kèo nhà cái tỷ lệ bóng đá Lab, một tổ chức nghiên cứu và phát triển công nghệ trí tuệ nhân tạo, Kazuki Yamauchi※1, hai bài báo của các nhà nghiên cứu Masato Murata, Shogo Seki, Junya Oguchi và Tomoki Koriyama đã được trình bày tại hội nghị quốc tế về lĩnh vực xử lý tín hiệu giọng nói và âm thanh "ICASSP 2026"※2"ICASSP" là một trong những hội nghị quốc tế uy tín nhất về xử lý tín hiệu giọng nói/âm thanh và các lĩnh vực liên quan, được tài trợ bởi Hiệp hội xử lý tín hiệu IEEE Các bài viết được chấp nhận sẽ được trình bày tại ICASSP 2026, được tổ chức tại Barcelona, Tây Ban Nha vào tháng 5 năm 2026
■NềnTrong những năm gần đây, với sự phát triển của học máy, việc tạo ra các quảng cáo mới và tiếp thị kỹ thuật số sử dụng công nghệ kèo nhà cái tỷ lệ bóng đá đã thu hút được sự chú ý Tại kèo nhà cái tỷ lệ bóng đá Lab, chúng tôi đang mở rộng phạm vi lĩnh vực nghiên cứu cũng như nghiên cứu và phát triển công nghệ kèo nhà cái tỷ lệ bóng đá để giải quyết các vấn đề kỹ thuật khác nhau trong các lĩnh vực này
Đặc biệt, nhóm Âm thanh, chịu trách nhiệm nghiên cứu trong lĩnh vực giọng nói và âm học, đang thúc đẩy phát triển công nghệ nhằm hiện thực hóa cuộc đối thoại bằng giọng nói tự nhiên và tiên tiến, chẳng hạn như giọng nói song sinh kỹ thuật số của những người nổi tiếng, quảng cáo bằng giọng nói và ứng dụng cho bot giọng nói của trung tâm cuộc gọi Hai bài báo được chấp nhận lần này đề xuất các phương pháp cải thiện hơn nữa độ chính xác kỹ thuật của nhận dạng giọng nói, tổng hợp giọng nói, chỉ báo đánh giá tự động, vv và dự kiến sẽ đóng góp nhiều hơn cho các biểu thức quảng cáo thế hệ tiếp theo và các dịch vụ khác nhau sử dụng công nghệ giọng nói
■Tóm tắt bài viết
「”Tác giả: Kazuki Yamauchi (Trường sau đại học của Đại học Tokyo), Masato Murata (Phòng thí nghiệm kèo nhà cái tỷ lệ bóng đá của CyberAgent), Shogo Seki (Phòng thí nghiệm kèo nhà cái tỷ lệ bóng đá của CyberAgent)
| Cải tiến giọng nói tổng hợp là công nghệ giúp cải thiện chất lượng giọng nói bị suy giảm do tiếng ồn xung quanh, tiếng vang, vv Mặc dù công nghệ này đóng vai trò quan trọng trong việc quản lý dữ liệu của nội dung âm thanh, nhưng có nguy cơ là quá trình loại bỏ tiếng ồn có thể gây ra ảo giác cụ thể như ''thiếu âm vị'' và ''sự không nhất quán trong đặc điểm của loa''
Trong nghiên cứu này, chúng tôi đã đề xuất một phương pháp lọc đầu ra không phù hợp như ảo giác bằng cách sử dụng điểm tin cậy dựa trên phân bố xác suất khi mô hình phát ra lời nói Kết quả thực nghiệm cho thấy phương pháp này có thể phát hiện hiệu quả các lỗi ảo giác, vốn khó phát hiện bằng các phương pháp lọc thông thường Điều này dẫn đếnCó thể xây dựng một cách hiệu quả tập dữ liệu đào tạo có độ tin cậy cao từ một lượng lớn tài nguyên âm thanh, bao gồm cả tiếng ồn trong môi trường thực |
「」Tác giả: Junya Koguchi (Phòng thí nghiệm kèo nhà cái tỷ lệ bóng đá của CyberAgent), Tomoki Koriyama (Phòng thí nghiệm kèo nhà cái tỷ lệ bóng đá của CyberAgent)
| ``Phương pháp biểu quyết'' tích hợp kết quả của nhiều mô hình đã được chứng minh bằng thực nghiệm là có hiệu quả trong việc ước tính ``cao độ (tần số cơ bản)'' tạo thành cơ sở cho phân tích lời nói và âm nhạc, nhưng sự hỗ trợ về mặt lý thuyết của nó vẫn chưa đủTrong nghiên cứu này, về mặt lý thuyết, chúng tôi đã làm rõ rằng việc tích hợp nhiều phương pháp sẽ làm giảm phương sai lỗiĐể cải thiện hơn nữa tính thực tiễn, chúng tôi đã cải thiện độ chính xác của ước tính bằng cách sử dụng phương pháp căn chỉnh giúp hiệu chỉnh sự khác biệt về thời gian và tần số theo từng phút giữa mỗi mô hình và bằng cách chọn các công cụ ước tính có độ tương quan sai số thấp, chúng tôi đã có thể xây dựng các tổ hợp có độ chính xác ước tính cao ngay cả trong những tình huống không thể thu được dữ liệu chính xác
Điều này cho phépCó sẵn để phân tích cực kỳ chính xác vượt xa các phương pháp thông thường, tiên tiến đối với nhiều loại tín hiệu, chẳng hạn như không chỉ giọng nói mà còn cả giọng hát và âm thanh nhạc cụとなりました。Vì có thể ước tính ổn định ngay cả trong môi trường khắc nghiệt có nhiều tiếng ồn nên dự kiến nó sẽ được áp dụng trong nhiều tình huống thực tế khác nhau, chẳng hạn như chuyển đổi giọng hát và ước tính giọng hát |
■Tương laiTại kèo nhà cái tỷ lệ bóng đá Lab, chúng tôi sẽ áp dụng những kết quả nghiên cứu này để cải tiến công nghệ tổng hợp giọng nói trong sản xuất quảng cáo video và cho các sản phẩm hỗ trợ tạo nội dung chất lượng cao như con người ảo
Chúng tôi sẽ tiếp tục thúc đẩy triển khai các sản phẩm công nghệ kèo nhà cái tỷ lệ bóng đá giúp giải quyết các vấn đề kinh doanh và xã hội, cũng như tham gia nghiên cứu và phát triển để đóng góp vào sự phát triển hơn nữa của công nghệ và học thuật
※1 Liên kết với Trường Cao học Đại học Tokyo Tham gia thực tập nghiên cứu từ ngày 2 tháng 7 năm 2025
※2