CyberAgent Co, Ltd (Trụ sở chính: Shibuya-ku, Tokyo, Chủ tịch kiêm Giám đốc điều hành: Takahiro Yamauchi, TSE Prime Market: Mã chứng khoán: 4751) là một công ty được thành lập bởi Kaito Ariu và Kenyuki Abe, các nhà nghiên cứu thuộc Phòng thí nghiệm kèo bóng đá ngày mai, một tổ chức nghiên cứu và phát triển công nghệ trí tuệ nhân tạo, Po-An Wang của Đại học Quốc gia Thanh Hoa và Alexandre của Viện Công nghệ Hoàng gia Thụy Điển Một bài báo của ông Proutiere đã được trình bày tại AISTATS 2026, một hội nghị quốc tế lớn về học máy và thống kê※1
``AISTATS'' là hội nghị quốc tế được tổ chức thường xuyên bởi các nhà nghiên cứu từ khắp nơi trên thế giới, cùng với ``NeurIPS'' và ``ICML'', đây là một trong những hội nghị quốc tế uy tín nhất trong lĩnh vực học máy và thống kê Bài báo được chấp nhận dự kiến sẽ được trình bày tại AISTATS 2026, được tổ chức tại Tangier, Maroc vào tháng 5 năm 2026
■Nền"Phòng thí nghiệm kèo bóng đá ngày mai" nghiên cứu và phát triển nhiều công nghệ kèo bóng đá ngày mai liên quan đến tiếp thị nói chung, đồng thời đang giải quyết nhiều vấn đề công nghệ khác nhau, đồng thời tăng cường hợp tác giữa ngành và học viện với các trường đại học và tổ chức học thuật Đặc biệt, nhóm nghiên cứu trong lĩnh vực học tăng cường nhằm mục đích thiết lập công nghệ tự động hóa và tối ưu hóa quá trình ra quyết định, nhắm mục tiêu ra quyết định tuần tự như lựa chọn quảng cáo trong quảng cáo trên Internet
Để triển khai các chiến lược ra quyết định này vào các dịch vụ thực, cần phải xác minh một cách đáng tin cậy liệu thuật toán mới có đáp ứng các tiêu chí hiệu suất được xác định trước bằng cách sử dụng một số lần thử nghiệm hạn chế hay không Đặc biệt, nếu có thể sử dụng lịch sử trạng thái như lịch sử đăng nhập của người dùng thì việc xác minh sẽ hiệu quả hơn Mặt khác, về mặt kỹ thuật, rất khó để thiết kế một phương pháp xác định sử dụng lịch sử trạng thái để giảm thiểu số lượng thử nghiệm cần thiết trong khi vẫn giữ xác suất dương tính giả dưới mức xác định trước
■Tóm tắt bài viết
Được thông qua gần đây “'', chúng tôi đã xử lý ``Kiểm tra chính sách'', xác định xem hiệu suất của một chính sách nhất định (quy tắc ra quyết định) có vượt quá ngưỡng hay không bằng cách sử dụng số lượng thử nghiệm tối thiểu trong Quy trình ra quyết định Markov (MDP), một mô hình toán học để ra quyết định tuần tự
Trước đây, các bài toán tối ưu hóa xuất hiện khi xây dựng phương pháp xác định tối ưu về mặt lý thuyết rất khó giải trực tiếp do tính phức tạp trong tính toán Trong nghiên cứu này, chúng tôi đã chỉ ra rằng vấn đề tối ưu hóa này có thể được chuyển đổi thành vấn đề học chính sách và thiết lập một phương pháp để giải quyết nó một cách hiệu quả bằng phương pháp gradient mục đích chung trong học máy Hơn nữa, chúng tôi đã chứng minh rằng phương pháp của chúng tôi có hiệu suất tối ưu đạt đến giới hạn lý thuyết thông tin Kết quả này được kỳ vọng sẽ trở thành công nghệ cơ bản để đánh giá và thăm dò chính sách hiệu quả về dữ liệu ở MDP
■Tương laiPhương pháp này mở rộng khả năng thực hiện xác thực trước khi triển khai các chiến lược ra quyết định với ít thử nghiệm hơn và có độ tin cậy cao Chúng tôi sẽ tiếp tục áp dụng công nghệ này để tự động lựa chọn các tài liệu sáng tạo quảng cáo và hệ thống đề xuất, từ đó liên tục cải thiện hiệu suất và triển khai chức năng nhanh chóng“Phòng thí nghiệm kèo bóng đá ngày mai” sẽ tiếp tục thúc đẩy nghiên cứu và phát triển các công nghệ cốt lõi của các sản phẩm cạnh tranh
※1: "AISTATS 2026"