通过 LLM 蒸馏适配金融报告的嵌入模型
计算与语言
2025-12-10 v1
摘要
尽管生成式大语言模型(LLM)取得了进展,但专门化的对话式 AI 代理的实际应用仍受计算成本、延迟要求以及精确的领域特定相关性度量需求的制约。虽然现有的嵌入模型解决了前两个约束,但在金融等专业领域的信息检索方面表现不佳。本文引入了一个可扩展的管道,通过通用检索嵌入模型作为基础,从未标记语料库中训练专门模型。我们的方法在 14 种金融报告类型上测得的 21,800 组查询-文档对上,平均提升了 27.7% 的 MRR@5,44.6% 的平均 DCG@5,并在 FinanceBench 的 4 个文档类别中提升了 NDCG。我们针对 RAG 使用检索嵌入(双编码器),而非 LLM 生成器,利用 LLM 评估的相关性将领域知识蒸馏到紧凑检索器中。已有工作会将合成查询与真实段落组合,直接微调检索模型。我们的管道与这些方法不同之处在于,引入了学生模型与教师模型之间的交互,将从未标记语料库中基于检索挖掘硬正/负例与迭代重新训练学生模型权重相交织。每一次检索迭代都使用优化后的学生模型从语料库中挖掘更难的训练示例,以进行下一轮训练。该方法为在不需人工标注的情况下,以经济有效的方式弥合通用模型与专业领域之间的差距。
引用
@article{arxiv.2512.08088,
title = {Adaptation of Embedding Models to Financial Filings via LLM Distillation},
author = {Eliot Brenner and Dominic Seyler and Manjunath Hegde and Andrei Simion and Koustuv Dasgupta and Bing Xiang},
journal= {arXiv preprint arXiv:2512.08088},
year = {2025}
}
备注
In proceedings of LLM-Finance 2025 : The 2nd IEEE International Workshop on Large Language Models for Finance