AI Lab, bài báo được chấp nhận tại "EMNLP 2024", hội nghị hàng đầu soi kèo bóng đá anh lĩnh vực xử lý ngôn ngữ tự nhiên
-Đề xuất phương pháp lựa chọn dữ liệu học tập chất lượng cao cho học tập tăng cường dựa trên phản hồi của con người (RLHF)-
Quảng cáo|
CyberAgent Co, Ltd (Trụ sở chính: Shibuya-ku, Tokyo, Giám đốc đại diện: Susumu Fujita, TSE Prime Market: Mã chứng khoán 4751) đã thông báo rằng một bài báo của các nhà nghiên cứu Tetsuro Morimura, Mitsuo Sakamoto, Tasuku Jinnai, Kenyuki Abe và Kaito Ariu, những người thuộc tổ chức nghiên cứu và phát triển công nghệ trí tuệ nhân tạo "AI Lab", sẽ được xuất bản tại EMNLP, hội nghị quốc tế về lĩnh vực trí tuệ nhân tạo và xử lý ngôn ngữ tự nhiên 2024 (Hội nghị năm 2024 về các phương pháp thực nghiệm soi kèo bóng đá anh xử lý ngôn ngữ tự nhiên, sau đây gọi là EMNLP)”※1Đây là lần đầu tiên công ty chúng tôi một đề xuất được thông qua tại cuộc họp toàn thể EMNLP
“EMNLP” là hội thảo quốc tế được tổ chức thường xuyên bởi các nhà nghiên cứu từ khắp nơi trên thế giới và “ACL” “NAACL”※2, đây là một soi kèo bóng đá anh những hội nghị quốc tế uy tín nhất soi kèo bóng đá anh lĩnh vực xử lý ngôn ngữ tự nhiên (NLP) Bài báo được chấp nhận dự kiến sẽ được trình bày tại "EMNLP 2024" được tổ chức tại Miami, Florida, Hoa Kỳ vào tháng 11 năm 2024
■Nền
soi kèo bóng đá anh những năm gần đây, sự phát triển của các mô hình ngôn ngữ quy mô lớn (LLM), vốn đóng vai trò trung tâm soi kèo bóng đá anh công nghệ AI, đã tăng tốc trên toàn thế giới Tầm quan trọng của việc áp dụng LLM vào kinh doanh cũng ngày càng tăng ở Nhật Bản và việc sử dụng nó soi kèo bóng đá anh lĩnh vực quảng cáo và tiếp thị cũng đang thu hút sự chú ý
Để nâng cao hiệu quả quảng cáo, điều cần thiết là phải truyền tải thông điệp tối ưu đến từng người dùng theo sở thích và mối quan tâm của họ Bằng cách sử dụng LLM, có thể tạo ra các phản hồi phù hợp phù hợp với giá trị và ý định của con người, đồng thời được kỳ vọng sẽ cải thiện hiệu quả và chất lượng
Với nền tảng này, nhóm Học tăng cường của AI Lab đã cộng tác với các nhóm nghiên cứu soi kèo bóng đá anh lĩnh vực xử lý ngôn ngữ tự nhiên để tiến hành nghiên cứu và phát triển nhằm cải thiện hiệu quả quảng cáo, chẳng hạn như tự động tạo văn bản chất lượng cao bằng LLMNghiên cứu này đặc biệt tập trung vào kỹ thuật "căn chỉnh" của LLM sử dụng RLHF (học tăng cường dựa trên phản hồi của con người) Bằng cách sử dụng công nghệ này, chúng tôi mong muốn điều chỉnh phản hồi LLM để phù hợp hơn với người dùng và tối đa hóa hiệu quả của quảng cáo và tiếp thị
■Bài viết tóm tắt
Bài viết được chấp nhận lần này ``'' đề xuất ``DPO đã lọc'', một cách tiếp cận mới đối với DPO (Tối ưu hóa tùy chọn trực tiếp), đang thu hút sự chú ý như một phương pháp điều chỉnh LLM dựa trên phản hồi của con người DPO là phương pháp tối ưu hóa trực tiếp phản hồi LLM bằng cách sử dụng phản hồi của con người làm dữ liệu học tập, không giống như các phương pháp học tăng cường truyền thốngNghiên cứu này lần đầu tiên tiết lộ rằng hiệu suất của DPO giảm đáng kể khi dữ liệu huấn luyện chứa phản hồi chất lượng thấp Tiếp theo, để giải quyết vấn đề này, chúng tôi đã giới thiệu một phương pháp loại bỏ dữ liệu không cần thiết dựa trên chất lượng dữ liệu (xem Hình 1)
Kết quả thử nghiệm đã xác nhận rằng phương pháp "DPO đã lọc" được đề xuất có thể tạo ra phản hồi ổn định và chất lượng cao hơn so với DPO thông thường ngay cả khi chất lượng dữ liệu thưa thớt (xem Hình 2)
Hình 1: Tổng quan về phương pháp được đề xuất “DPO được lọc”
Đánh giá chất lượng dữ liệu bằng mô hình khen thưởng và xóa dữ liệu nếu dữ liệu đó có chất lượng thấp hơn phản hồi do LLM tạo ra Bộ lọc này cho phép học tập chỉ bằng cách sử dụng dữ liệu chất lượng caoHình 2: Kết quả đánh giá hiệu suất căn chỉnh LLM sử dụng DPO thông thường và phương pháp đề xuất "Filtered DPO" (điểm đánh giá càng cao thì càng tốt)
Chúng tôi đã so sánh hiệu suất trên tập dữ liệu chất lượng cao và tập dữ liệu chất lượng hỗn hợp và phương pháp được đề xuất cho thấy điểm đánh giá cao ngay cả trên tập dữ liệu chất lượng hỗn hợp
■Tương lai
Công nghệ căn chỉnh LLM ngày càng trở nên quan trọng soi kèo bóng đá anh nhiều lĩnh vực như tạo quảng cáo, phản hồi đối thoại và tạo kịch bản Độ chính xác của nó phần lớn phụ thuộc vào chất lượng của dữ liệu huấn luyện, nhưng khi lượng dữ liệu tăng lên, không thể tránh khỏi dữ liệu chất lượng thấp sẽ bị trộn vào "Filtered DPO", phương pháp được đề xuất soi kèo bóng đá anh nghiên cứu này, lọc dữ liệu này một cách hiệu quả và giúp cải thiện ổn định hiệu suất của LLM
Ngoài việc tạo văn bản quảng cáo, kết quả của nghiên cứu này dự kiến sẽ được sử dụng soi kèo bóng đá anh ``công nghệ tạo văn bản quảng cáo tự động'' soi kèo bóng đá anh chuỗi dự đoán cực của chúng tôi và ``tự động xem xét các quảng cáo'' bằng cách sử dụng AI sàng lọc soi kèo bóng đá anh tương lai, "Phòng thí nghiệm AI" sẽ tiếp tục tham gia nghiên cứu công nghệ AI tiên tiến, thúc đẩy sự phát triển LLM dễ sử dụng hơn và hiệu suất cao hơn, đồng thời đóng góp vào ứng dụng thực tế và thúc đẩy học tập tăng cường
※1
※2