中文

多语言用户生成内容中情感翻译的挑战:以Twitter为例

计算与语言 2021-10-01 v1

摘要

尽管情感是普遍概念,但将不同层次的情感从一种语言转换到另一种语言,对人类译者而言未必总是直截了当,更不用说机器翻译系统了。此外,认知状态由经验的语言性解释所确立,而经验又受语言与文化语境的塑造。在许多语言语境中,情感表达构成信息的关键组成部分。对于用户生成内容(User-Generated Content, UGC)(如产品或服务的评论、推文或社交媒体帖子)而言尤其如此。近来,Twitter等多语言网站提供UGC的自动翻译以触达语言多样化的用户已成为常见做法。在此类场景中,用户情感的翻译过程完全自动化,无人介入,既无译后编辑也无准确性核查。在本研究中,我们评估自动翻译工具能否作为成功的实际应用,在推文等多语言用户生成数据中传递情感。我们表明,Twitter数据存在特定的语言现象,给不同语言间情感的翻译带来挑战。我们将这些挑战总结为一组语言特征列表,并展示这些特征在不同语言对中的出现频率。我们还评估了常用机器翻译(MT)系统性能评价方法在保留源文本情感方面的能力。

关键词

引用

@article{arxiv.2106.10719,
  title  = {Challenges in Translation of Emotions in Multilingual User-Generated Content: Twitter as a Case Study},
  author = {Hadeel Saadany and Constantin Orasan and Rocio Caro Quintana and Felix do Carmo and Leonardo Zilio},
  journal= {arXiv preprint arXiv:2106.10719},
  year   = {2021}
}