中文

Translator2Vec:理解与表征人工译后编辑者

计算与语言 2019-07-25 v1

摘要

机器与人类相结合的翻译方式是有效的,许多研究表明,与从零开始翻译相比,人类对机器翻译输出进行译后编辑能提高生产力。为了充分利用这种结合,我们需要对人工译者的工作方式以及哪种译后编辑风格更有效进行细致入微的理解。在本文中,我们发布并分析了一个包含文档级译后编辑动作序列的新数据集,其中包括来自按键、鼠标动作和等待时间的编辑操作。我们的数据集包含由 332 名人工编辑者完成的 66,268 个完整文档会话,是迄今为止发布的同类数据集中规模最大的。我们表明,与仅查看初始和最终文本的基线相比,动作序列包含足够的信息来准确识别译后编辑者。我们在此基础上学习并可视化译后编辑者的连续表征,并表明这些表征改进了预测译后编辑时间的下游任务。

关键词

引用

@article{arxiv.1907.10362,
  title  = {Translator2Vec: Understanding and Representing Human Post-Editors},
  author = {António Góis and André F. T. Martins},
  journal= {arXiv preprint arXiv:1907.10362},
  year   = {2019}
}

备注

Accepted on MT Summit 2019; dataset available here: https://www.github.com/Unbabel/translator2vec; please cite as: @article{gois2019translator2vec, title={Translator2Vec: Understanding and Representing Human Post-Editors}, author={G\'ois, Ant\'onio and F. T. Martins, Andr\'e}, year={2019}, publisher={European Association for Machine Translation} }