HiNS:用于更全面记忆检索嵌入模型的分层负采样
计算与语言
2026-01-22 v1
摘要
记忆增强型语言智能体依赖嵌入模型进行有效的记忆检索。然而,现有的训练数据构建忽略了一个关键局限:负样本的分层难度及其在人机交互中的自然分布。在实践中,一些负样本是语义相近的干扰项,而另一些则完全无关,且自然对话中这些类型呈现出结构化的比例。当前使用合成或均匀采样的负样本的方法未能反映这种多样性,限制了嵌入模型学习稳健记忆检索所必需的精细判别能力。在本工作中,我们提出了一个有原则的数据构建框架 HiNS,该框架显式地对负样本难度层级进行建模,并引入源自对话数据的经验性负样本比例,从而能够训练出在记忆密集型任务中具有显著提高的检索保真度和泛化能力的嵌入模型。实验表明了显著的改进:在 LoCoMo 上,F1/BLEU-1 提升了 3.27%/3.30%(MemoryOS)和 1.95%/1.78%(Mem0);在 PERSONAMEM 上,总分提升了 1.19%(MemoryOS)和 2.55%(Mem0)。
引用
@article{arxiv.2601.14857,
title = {HiNS: Hierarchical Negative Sampling for More Comprehensive Memory Retrieval Embedding Model},
author = {Motong Tian and Allen P. Wong and Mingjun Mao and Wangchunshu Zhou},
journal= {arXiv preprint arXiv:2601.14857},
year = {2026}
}