结合数据驱动监督与人在回路反馈的实体解析方法
计算与语言
2021-11-23 v1
摘要
训练数据集与生产环境中遇到的数据之间的分布差距是公认的。训练数据集通常在固定时间段内构建,并通过对待标注数据进行精心筛选而制成。因此,训练数据集可能不包含真实生产环境中可能遇到的所有数据变体。在构建实体解析系统(即识别并合并代表同一人的数据点的模型)的任务中,我们的首个模型表现出明显的训练-生产性能差距。在本案例研究中,我们讨论了通过人在回路赋能的、以数据为中心的解决方案来缩小训练-生产性能差异。最后我们总结了适用于广义以数据为中心学习的经验启示。
引用
@article{arxiv.2111.10497,
title = {Combining Data-driven Supervision with Human-in-the-loop Feedback for Entity Resolution},
author = {Wenpeng Yin and Shelby Heinecke and Jia Li and Nitish Shirish Keskar and Michael Jones and Shouzhong Shi and Stanislav Georgiev and Kurt Milich and Joseph Esposito and Caiming Xiong},
journal= {arXiv preprint arXiv:2111.10497},
year = {2021}
}
备注
Camera-ready for Data-Centric AI Workshop at NeurIPS 2021