中文

利用词汇、非词汇与话轮转换特征预测英语对话中的性别与年龄类别

计算与语言 2021-03-01 v1

摘要

本文考察英国英语口语中的性别与年龄显著性及(刻板)典型性,旨在基于词汇、短语和话轮转换特征预测性别与年龄类别。我们考察了 SpokenBNC——一个约含 1140 万词的英国英语对话语料库,并识别出按性别与年龄类别标注的说话者之间的行为差异。我们探究语言使用与话轮转换动态中的差异,并确定了一系列区分这些类别的特征。我们发现女性说话者往往产生更多且略长的话轮,而男性说话者的话轮具有更高的类符-形符比以及一组独特的最小话语粒子如“eh”、“uh”和“em”。在各年龄组中,我们观察到例如脏话与笑声是年轻说话者谈话的特征,而老年说话者往往产生更多截断词。随后我们将观察到的特征用于按对话和按话轮预测说话者的性别与年龄标签,作为一项分类任务,表明通常排除在对话数据之外的非词汇话语(如最小话语粒子)有助于区分这些类别。

关键词

引用

@article{arxiv.2102.13355,
  title  = {Predicting gender and age categories in English conversations using lexical, non-lexical, and turn-taking features},
  author = {Andreas Liesenfeld and Gábor Parti and Yu-Yin Hsu and Chu-Ren Huang},
  journal= {arXiv preprint arXiv:2102.13355},
  year   = {2021}
}

备注

10 pages