中文

东南亚语言的多模态数据中枢与基准套件 SEACrowd

计算与语言 2025-03-12 v5

摘要

东南亚 (SEA) 是一个语言多样性和文化多样性丰富的地区,拥有超过1300种土著语言和6.71亿人口。然而,现存AI模型在表示来自SEA的文本、图像和音频数据方面存在显著不足,影响了针对SEA语言的AI模型质量。由于稀缺的高质量数据集以及英语训练数据的主导地位,评估SEA语言的模型具有挑战性,这引发对潜在文化误表示的担忧。为应对这些挑战,我们引入SEACrowd,这是一个合作性计划,整合了全面的资源中枢,通过提供近1000种SEA语言跨三种模态的标准化语料库来填补资源差距。通过我们的SEACrowd基准,我们在36种土著语言上的13项任务中评估了AI模型质量,为了解SEA当前AI图景提供了宝贵见解。此外,我们提出了策略,以促进更大的AI进步,最大化未来AI在SEA的潜在实用性和资源公平性。

关键词

引用

@article{arxiv.2406.10118,
  title  = {SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages},
  author = {Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya},
  journal= {arXiv preprint arXiv:2406.10118},
  year   = {2025}
}

备注

https://seacrowd.github.io/ Published in EMNLP 2024