中文

低标注预算约束下领域特定问答的微调策略

计算与语言 2024-01-18 v1

摘要

预训练语言模型及其微调带来的进展已导致大多数下游NLP任务的显著改进。语言模型的无监督训练结合进一步的目标任务微调已成为标准的问答微调流程。在这项工作中,我们证明了这种策略对于微调问答模型是次优的,特别是在低问答标注预算下,由于抽取式问答标注成本,这在实践中是常见设置。我们通过对不同问答数据集上顺序微调策略的替代方案的性能进行详尽分析,得出了我们的结论。基于所进行的实验,我们观察到在低预算设置下微调问答模型的最佳策略是采用预训练语言模型(PLM),然后使用由目标数据集和SQuAD数据集组成的数据集对PLM进行微调。在零额外标注工作的情况下,最佳策略比标准策略高出2.28%至6.48%。我们的实验提供了关于如何在低预算下最好地微调问答系统的首批研究之一,因此对问答实践者具有极大的实际意义。

关键词

引用

@article{arxiv.2401.09168,
  title  = {Fine-tuning Strategies for Domain Specific Question Answering under Low Annotation Budget Constraints},
  author = {Kunpeng Guo and Dennis Diefenbach and Antoine Gourru and Christophe Gravier},
  journal= {arXiv preprint arXiv:2401.09168},
  year   = {2024}
}