基于用户反馈模拟抽取式问答的Bandit学习
计算与语言
2022-03-21 v1
摘要
我们通过使用监督数据模拟反馈来研究从用户反馈中学习抽取式问答。我们将该问题视为上下文赌博机(contextual bandit)学习,并分析几种学习场景的特征,重点在于减少数据标注。我们表明,最初在少量示例上训练的系统在用户对模型预测答案的反馈下可以大幅改进,并且可以使用现有数据集在新领域中部署系统而无需任何标注,而是通过用户反馈即时改进系统。
引用
@article{arxiv.2203.10079,
title = {Simulating Bandit Learning from User Feedback for Extractive Question Answering},
author = {Ge Gao and Eunsol Choi and Yoav Artzi},
journal= {arXiv preprint arXiv:2203.10079},
year = {2022}
}
备注
ACL 2022