X-Stance:用于立场检测的多语言多目标数据集
计算与语言
2020-06-11 v2
摘要
我们从瑞士选举候选人撰写的评论中提取了一个大规模的立场检测数据集。该数据集由德语、法语和意大利语文本组成,支持立场检测的跨语言评测。它包含针对 150 多个政治议题(目标)的 67 000 条评论。与针对特定目标议题的立场检测模型不同,我们使用该数据集在所有议题上训练单一模型。为了使跨目标学习成为可能,我们在每个实例前附加一个代表该目标的自然问题(例如“你支持 X 吗?”)。多语言 BERT 的基线结果表明,采用该方法进行零样本跨语言和跨目标立场检测迁移取得了中等程度的成功。
引用
@article{arxiv.2003.08385,
title = {X-Stance: A Multilingual Multi-Target Dataset for Stance Detection},
author = {Jannis Vamvas and Rico Sennrich},
journal= {arXiv preprint arXiv:2003.08385},
year = {2020}
}
备注
SwissText + KONVENS 2020. Data and code are available at https://github.com/ZurichNLP/xstance