CyberAgent Co, Ltd (Trụ sở chính: Shibuya-ku, Tokyo, Chủ tịch kiêm Giám đốc điều hành: Susumu Fujita, Được niêm yết trên Phần đầu tiên của Sở giao dịch chứng khoán Tokyo: Mã chứng khoán: 4751) đã thông báo rằng một bài báo của Kota Yamaguchi, một nhà khoa học nghiên cứu thuộc tổ chức nghiên cứu và phát triển công nghệ trí tuệ nhân tạo “kèo trực tiếp bóng đá hôm nay Lab”, sẽ được trình bày tại hội nghị quốc tế về lĩnh vực thị giác máy tính “ICCV 2021”
※1
"ICCV" là hội nghị quốc tế về lĩnh vực thị giác máy tính và nhận dạng hình ảnh được tổ chức hai năm một lần và "CVPR"
※2"ECCV"
※3, đây là một trong những hiệp hội học thuật có uy tín trong lĩnh vực này Vào năm 2021, tỷ lệ chấp nhận là khoảng 25% Lần này, "kèo trực tiếp bóng đá hôm nay Lab" đã xuất bản bài viết này cũng như bài báo đồng tác giả của các nhà khoa học nghiên cứu của kèo trực tiếp bóng đá hôm nay Lab Kazu Shimoda, Kota Yamaguchi, Daichi Haraguchi của Trường Cao học Đại học Kyushu và Giáo sư Seiichi Uchida
※4đã được chọn và sẽ được công bố tại "ICCV 2021", được tổ chức trực tuyến vào tháng 10 năm 2021
※4 Giới thiệu về bài viết đồng tác giả “Hủy hiển thị văn bản cách điệu”Thông cáo báo chí nàyXem chi tiết
■Bối cảnh nghiên cứuNhóm Nghiên cứu Sáng tạo của Phòng thí nghiệm kèo trực tiếp bóng đá hôm nay đang nghiên cứu nhiều loại công nghệ kèo trực tiếp bóng đá hôm nay liên quan đến thể hiện sáng tạo nói chung, đồng thời đang nghiên cứu và phát triển các công nghệ kèo trực tiếp bóng đá hôm nay liên quan đến hỗ trợ sản xuất và tự động hóa các thiết kế sáng tạo, vốn rất quan trọng để tạo ra các quảng cáo hiệu quả Trong nghiên cứu này, chúng tôi đề xuất một phương pháp tạo hình ảnh "định dạng vector", một phương pháp quan trọng trong sản xuất sáng tạo
Khi tạo các thiết kế sáng tạo như quảng cáo biểu ngữ và quảng cáo video, người ta thường tạo và chỉnh sửa ở định dạng được gọi là định dạng vectơ, định dạng này ghi lại hình ảnh dưới dạng tập hợp các hình dạng và văn bản cấu thành (tiện ích mở rộng: kèo trực tiếp bóng đá hôm nay hoặc PDF) Không giống như định dạng raster (phần mở rộng: JPEG hoặc PNG), trong đó thiết kế được tạo thành từ các dấu chấm trên cơ sở từng pixel, định dạng vectơ lưu trữ thông tin dưới dạng dữ liệu thô dưới dạng tập hợp siêu dữ liệu về các đối tượng, văn bản và đồ trang trí của chúng Bằng cách này, bạn sẽ có thể dễ dàng thay đổi màu văn bản và tinh chỉnh vị trí của các đối tượng, giúp nó có khả năng chống lại việc mở rộng và biến đổiMặt khác, các công nghệ tạo hình ảnh như mạng đối thủ tổng quát (GAN), vốn đã trở thành chủ đề nóng trong vài năm qua, thường sử dụng các phương pháp định dạng raster để xuất trực tiếp các pixel Tuy nhiên, con người khó có thể chỉnh sửa lại hình ảnh pixel ở định dạng raster một khi chúng đã được tạo và cũng khó kiểm soát hoàn toàn chất lượng hình ảnh do GAN tạo ra Vì lý do này, rất khó để trực tiếp giới thiệu các công nghệ tạo hình ảnh hiện có, chẳng hạn như GAN, tạo ra hình ảnh pixel, trong quá trình sản xuất các quảng cáo yêu cầu điều chỉnh thiết kế chi tiết
■Tổng quan nghiên cứu luận ánVới nền tảng này, công ty chúng tôi đang nỗ lực xây dựng một mô hình deep learning trực tiếp tạo ra các đối tượng hình ảnh có định dạng vector và đang tiến hành nghiên cứu Bài viết được ICCV chấp nhận lần này ``」
※5, chúng tôi đã phát triển và đề xuất một phương pháp học để tái cấu trúc và tạo các đối tượng hình ảnh có định dạng vector bằng cách sử dụng mạng thần kinh có tên là Bộ mã hóa tự động biến đổi (VAE)
Cho đến nay, đã có mô hình deep learning cho cả GAN và VAE tạo ra hình ảnh có định dạng raster, nhưng chưa có mô hình nào xử lý trực tiếp hình ảnh có định dạng vector và tạo ra hoàn toàn ở định dạng vector như mô hình được đề xuất trong đề xuất này
Trong nghiên cứu này, chúng tôi đề xuất một phương pháp học tập định vị đối tượng hình ảnh định dạng vector từ một "khung vẽ" thể hiện tổng thể và một tập hợp các "yếu tố riêng lẻ" như văn bản và cách xử lý, đồng thời thể hiện thông tin bằng cách kết hợp cấu trúc mô hình VAE và cấu trúc Transformer, một trong những cấu trúc mạng thần kinh điển hình