中文

仅使用英文标注检测多语言中的食源性疾病投诉

计算与语言 2020-10-13 v1

摘要

卫生部门已部署文本分类系统,用于早期检测社交媒体文档(如 Yelp 餐厅评论)中的食源性疾病投诉。现有系统已成功应用于英文文档,因此一个有前景的方向是通过考虑西班牙语或中文等其它语言的文档来提高覆盖率和召回率。然而,为更多语言训练先前的系统代价高昂,因为需要为每种新目标语言手动标注大量文档。为应对这一挑战,我们考虑跨语言学习,并仅使用英文评论的标注来训练多语言分类器。近期基于预训练多语言 BERT (mBERT) 的零样本方法已被证明能有效对齐情感等方面的语言。有趣的是,我们表明这些方法在捕捉我们关注的公共卫生应用——食源性疾病——的细微差别上效果较差。为在无额外标注情况下提升性能,我们通过机器翻译在目标语言中创建人工训练文档,并联合源语言(英文)与目标语言训练 mBERT。此外,我们表明将标注文档翻译为多种语言可为部分目标语言带来额外的性能提升。我们通过对七种语言的 Yelp 餐厅评论进行大量实验,展示了我们方法的好处。我们的分类器从 Yelp Challenge 数据集的多语言评论中识别食源性疾病投诉,这凸显了我们的通用方法在卫生部门部署的潜力。

关键词

引用

@article{arxiv.2010.05194,
  title  = {Detecting Foodborne Illness Complaints in Multiple Languages Using English Annotations Only},
  author = {Ziyi Liu and Giannis Karamanolakis and Daniel Hsu and Luis Gravano},
  journal= {arXiv preprint arXiv:2010.05194},
  year   = {2020}
}

备注

Accepted for the 11th International Workshop on Health Text Mining and Information Analysis (LOUHI@EMNLP 2020)