MHA-RAG:通过编码软提示提高效率、准确性和一致性
人工智能
2025-10-08 v1
摘要
利用有限训练数据适配基石模型具有挑战性且计算成本高昂。虽然先前工作已证明使用领域特定示例作为in-context演示的有效性,但我们探讨了是否将示例纯粹表示为文本是最有效、最稳健的方法。我们探索了另一种选择:将示例表示为软提示,并采用exemplar order不变模型架构。为此,我们引入Multi-Head Attention Retrieval-Augmented Generation(MHA-RAG),该框架将注意力头的数量作为简单超参数以控制软提示在不同任务上的生成。跨多个问答基准和模型规模,MHA-RAG在标准RAG之上实现了20分的性能提升,同时将推理成本降低10倍GFLOPs,实现了更高的准确率和更高的效率,且对exemplar order具有不变性。
关键词
引用
@article{arxiv.2510.05363,
title = {MHA-RAG: Improving Efficiency, Accuracy, and Consistency by Encoding Exemplars as Soft Prompts},
author = {Abhinav Jain and Xinyu Yao and Thomas Reps and Christopher Jermaine},
journal= {arXiv preprint arXiv:2510.05363},
year = {2025}
}
备注
17 pages, 5 figures