一种高效生成质量估计数据集的新工具
计算与语言
2021-11-02 v1
摘要
构建用于质量估计(QE)训练的数据成本高昂且需要大量人力。本研究在进行 QE 时聚焦于以数据为中心的方法,随后提出一种全自动伪 QE 数据集生成工具,该工具仅接收单语或平行语料库作为输入即可生成 QE 数据集。因此,无论是通过数据增强,还是通过鼓励多语言对利用 QE 的适用性,QE 性能均得到提升。此外,我们打算公开发布这一用户友好的 QE 数据集生成工具,因为我们相信该工具为学界开发 QE 数据集提供了一种新颖且低成本的方法。
引用
@article{arxiv.2111.00767,
title = {A New Tool for Efficiently Generating Quality Estimation Datasets},
author = {Sugyeong Eo and Chanjun Park and Jaehyung Seo and Hyeonseok Moon and Heuiseok Lim},
journal= {arXiv preprint arXiv:2111.00767},
year = {2021}
}
备注
Accepted for Data-centric AI workshop at NeurIPS 2021