中文

TyDiP:一个涵盖九种类型学多样语言的礼貌分类数据集

计算与语言 2022-11-30 v1

摘要

我们研究九种类型学多样语言中的礼貌现象。礼貌是交流的一个重要方面,有时被认为具有文化特异性,然而现有的计算语言学研究仅限于英语。我们创建了 TyDiP,一个包含九种语言中每种语言 500 个示例的三方礼貌标注数据集,共计 4.5K 个示例。我们评估了多语言模型识别礼貌水平的能力——它们表现出相当鲁棒的零样本迁移能力,但显著低于估计的人类准确率。我们进一步研究通过自动翻译和词典归纳将英语礼貌策略词典映射到九种语言,分析每种策略的影响在不同语言间是否保持一致。最后,我们通过迁移实验实证研究了形式性与礼貌之间的复杂关系。我们希望我们的数据集能支持各种研究问题与应用,从评估多语言模型到构建礼貌的多语言代理。

关键词

引用

@article{arxiv.2211.16496,
  title  = {TyDiP: A Dataset for Politeness Classification in Nine Typologically Diverse Languages},
  author = {Anirudh Srinivasan and Eunsol Choi},
  journal= {arXiv preprint arXiv:2211.16496},
  year   = {2022}
}

备注

EMNLP 2022 Findings. 16 pages, 8 figures, 11 tables. The data and code is publicly available at https://github.com/Genius1237/TyDiP