Twitter 上文本摘要中的方言多样性
计算机与社会
2021-04-06 v2 计算与语言
摘要
Twitter 上的讨论涉及不同社区以不同方言参与,通常有必要将大量帖子总结为代表性样本以提供概要。然而,任何此类代表性样本都应充分刻画底层方言多样性,以呈现代表各方言的参与社区之声。抽取式摘要算法执行构建子集的任务,以简洁捕捉任意给定帖子集的主题。然而,我们观察到常见摘要方法生成的摘要存在方言偏差,即它们常返回低估某些方言代表性的摘要。绝大多数现有“公平”摘要方法需要社会显著性属性标签(此处为方言)以确保所生成摘要相对于该社会显著性属性是公平的。尽管如此,在许多应用中这些标签并不存在。此外,由于社交媒体中方言的不断演化,标记或准确推断每篇社交媒体帖子的方言是不合理的。为纠正方言偏差,我们采用一种框架,将现有文本摘要算法作为黑盒,并利用一小方言多样句子集,返回相对更具方言多样性的摘要。关键在于,该方法不需要被摘要的帖子具有方言标签,确保多样化过程独立于方言分类/识别模型。我们在包含由种族或性别定义的不同社会群体所用方言帖子的 Twitter 数据集上展示了我们方法的有效性;在所有情况下,与标准文本摘要方法相比,我们的方法均带来改进的方言多样性。
引用
@article{arxiv.2007.07860,
title = {Dialect Diversity in Text Summarization on Twitter},
author = {Vijay Keswani and L. Elisa Celis},
journal= {arXiv preprint arXiv:2007.07860},
year = {2021}
}