中文

标签或不标签:面向神经机器翻译的混合主动学习

计算与语言 2024-12-19 v2 机器学习

摘要

主动学习 (AL) 技巧通过从未标记数据中选择较小的代表性子集进行标注,从而降低神经机器翻译 (NMT) 模型训练的标注成本。多样性抽样技术选择异构实例,而不确定性抽样方法则选择具有最高模型不确定性的实例。两种方法都有局限性——多样性方法可能提取多样但平凡的例子,而不确定性抽样则可能产生重复、缺乏信息的实例。为弥合这一差距,我们提出混合不确定性与多样性抽样 (HUDS),这是一种用于 NMT 域适应的 AL 策略,将不确定性和多样性相结合用于句子选择。HUDS 计算未标记句子的不确定性得分,然后对其进行分层。随后,在每个分层中对句子嵌入进行聚类,并通过到质心的距离计算多样性得分。最后使用结合不确定性和多样性的加权混合得分,用于选择每个 AL 迭代中最顶级的实例进行标注。在德英和法英 多域数据集上的实验表明,HUDS 在各种强 AL 基准上表现更佳。我们对 HUDS 的句子选择进行分析,表明其在早期 AL 迭代中优先选择具有高模型不确定性的多样实例进行标注。

关键词

引用

@article{arxiv.2403.09259,
  title  = {To Label or Not to Label: Hybrid Active Learning for Neural Machine Translation},
  author = {Abdul Hameed Azeemi and Ihsan Ayyub Qazi and Agha Ali Raza},
  journal= {arXiv preprint arXiv:2403.09259},
  year   = {2024}
}

备注

The 31st International Conference on Computational Linguistics (COLING 2025)