大规模多语言情感数据集语料库与多维度情感分类基准
计算与语言
2023-06-14 v1 人工智能
摘要
尽管在多语言语料库收集和模型训练方面取得了令人瞩目的进展,开发大规模多语言模型的部署仍然是一项重大挑战。对于依赖文化的语言任务而言尤其如此。多语言情感分析就是一个例子,其中情感标记可能很微妙且深植于文化之中。本工作提出了用于训练情感模型的最广泛开放的规模化多语言数据集语料库。该语料库由根据严格质量标准从科学文献中报道的 350 多个数据集中手动筛选出的 79 个数据集组成。语料库涵盖代表 6 个语系的 27 种语言。可使用若干语言学和功能性特征对数据集进行查询。此外,我们提出了一个多维度情感分类基准,总结了在不同基础模型、训练目标、数据集收集和微调策略上进行的数百次实验。
引用
@article{arxiv.2306.07902,
title = {Massively Multilingual Corpus of Sentiment Datasets and Multi-faceted Sentiment Classification Benchmark},
author = {Łukasz Augustyniak and Szymon Woźniak and Marcin Gruza and Piotr Gramacki and Krzysztof Rajda and Mikołaj Morzy and Tomasz Kajdanowicz},
journal= {arXiv preprint arXiv:2306.07902},
year = {2023}
}
备注
submitted to NeurIPS 2023 Datasets and Benchmarks track. Dataset: https://huggingface.co/datasets/Brand24/mms Code: https://github.com/Brand24-AI/mms_benchmark