中文

通过合成偏好强化学习提高自动生成问题的难度

计算与语言 2024-10-14 v1 人工智能

摘要

随着文化遗产领域日益采用诸如检索增强生成(RAG)等技术,以提供更个性化的搜索体验并实现与收藏数据对话的需求不断增长。虽然端到端系统测试至关重要,但评估各个组件也同样重要。我们针对最终的解答任务,该任务非常适合机器阅读理解(MRC)。虽然现有的MRC数据集涵盖一般领域,但缺乏针对文化遗产信息的特定性。不幸的是,手动创建此类数据集对大多数遗产机构来说代价太高。本文提出一种基于合成偏好的强化学习的人类反馈(RLHF)的方法,用于以成本效益的方式生成具有提高难度的领域特定MRC数据集。我们的方法利用现有问答模型在SQuAD子集上的表现来创建难度度量标准,假设更具挑战性的问题被正确回答的频率更低。本研究的贡献包括:(1) 使用PPO和合成数据提高问题难度的方法ology;(2) 该方法的实证效果证明,包括人类评估;(3) 深入的错误分析和实现现象研究;以及 (4) 一个开源代码库和一组三个llama-2-chat适配器,用于可重复性和适应性。

关键词

引用

@article{arxiv.2410.08289,
  title  = {Increasing the Difficulty of Automatically Generated Questions via Reinforcement Learning with Synthetic Preference},
  author = {William Thorne and Ambrose Robinson and Bohua Peng and Chenghua Lin and Diana Maynard},
  journal= {arXiv preprint arXiv:2410.08289},
  year   = {2024}
}

备注

is to be published in NLP4DH 2024