基于众包标签的时间感知语言表示学习
计算与语言
2021-07-19 v1 人工智能
摘要
从众包标签中学习有效的语言表示对许多现实世界的机器学习任务至关重要。该问题的一个挑战性方面是众包标签的质量存在较高的观测者内与观测者间变异性。由于高容量深度神经网络可轻易记住众包标签中的所有不一致,直接应用现有监督语言表示学习算法可能产生次优解。本文提出\emph{TACMA},一种面向具有\underline{多}标注者的\underline{众}包标签的\underline{时}间\underline{感}知语言表示学习启发式方法。所提方法(1)利用注意力机制显式建模观测者内变异性;(2)计算并聚合来自多个工人的逐样本置信度分数以应对观测者间分歧。该启发式方法极易于实现,仅需约5行代码。所提启发式方法在四个合成与四个真实世界数据集上进行了评估。结果表明,我们的方法在预测准确率与AUC方面优于广泛的最先进基线。为鼓励可复现结果,我们将代码公开于\url{https://github.com/CrowdsourcingMining/TACMA}。
引用
@article{arxiv.2107.07958,
title = {Temporal-aware Language Representation Learning From Crowdsourced Labels},
author = {Yang Hao and Xiao Zhai and Wenbiao Ding and Zitao Liu},
journal= {arXiv preprint arXiv:2107.07958},
year = {2021}
}
备注
The 59th Annual Meeting of the Association for Computational Linguistics Workshop on Representation Learning for NLP (ACL RepL4NLP 2021)