作为语料库的视频游戏:基于《辐射:新维加斯》对话的情感分析
计算与语言
2022-12-06 v1
摘要
我们提出一种从《辐射:新维加斯》(Fallout New Vegas) 中提取多语言情感标注对话数据集的方法。游戏开发者已将游戏中每一句对话预标注为 8 种不同情感之一:\textit{anger, disgust, fear, happy, neutral, pained, sad} 与 \textit{surprised}。该游戏已被译为英语、西班牙语、德语、法语与意大利语。我们利用多语言 BERT、XLM-RoBERTa 及特定语言 BERT 模型,在提取的数据集上进行了多语言、多标签情感分析实验。实验中,多语言 BERT 对多数语言优于 XLMRoBERTa,且特定语言模型对多数语言略优于多语言 BERT。最佳总体准确率为 54%,由多语言 BERT 在西班牙语数据上取得。所提取数据集对情感分析提出了一项具挑战性的任务。我们已在 Zenodo 上公开发布该数据,含测试与训练划分。出于版权原因,数据集已被打乱。
引用
@article{arxiv.2212.02168,
title = {Video Games as a Corpus: Sentiment Analysis using Fallout New Vegas Dialog},
author = {Mika Hämäläinen and Khalid Alnajjar and Thierry Poibeau},
journal= {arXiv preprint arXiv:2212.02168},
year = {2022}
}
备注
FDG 2022