STAYKATE:面向科学领域的混合式上下文示例选择方法
计算与语言
2024-12-31 v1
摘要
大型语言模型(LLM)展示出在上下文中学习的能力,为科学信息抽取提供了潜在解决方案,这类任务常面临训练数据不足和标注成本高昂的挑战。鉴于上下文示例的选择对性能影响显著,重要的是要设计一种恰当的方法来抽样高效的示例。在本论文中,我们提出STAYKATE,一种静态-动态混合选择方法,结合了主动学习中代表性抽样原则与流行的检索方法。三个领域特定数据集上的结果表明,STAYKATE优于传统监督方法和现有选择方法。对于其他方法面临挑战的实体类型,STAYKATE的性能提升尤为显著。
引用
@article{arxiv.2412.20043,
title = {STAYKATE: Hybrid In-Context Example Selection Combining Representativeness Sampling and Retrieval-based Approach -- A Case Study on Science Domains},
author = {Chencheng Zhu and Kazutaka Shimada and Tomoki Taniguchi and Tomoko Ohkuma},
journal= {arXiv preprint arXiv:2412.20043},
year = {2024}
}