中文

硬度文本嵌入基准(HTEB):超越单维静态鲁棒性

计算与语言 2026-05-28 v1

摘要

诸如 MTEB 等嵌入基准会为每个模型报告单个分数,隐含地将鲁棒性视为静态、标量属性。我们认为,嵌入鲁棒性是多维的,因为不同类型的模型对不同变体的响应各不相同,需通过动态评估来暴露被静态基准隐藏的失效。我们引入了更硬的文本嵌入基准(HTEB),它是一个动态评估框架,通过在评估时对输入进行随机变换(由大语言模型完成),沿三个在实际中可解释的轴线(词汇/风格、长度和语言)挑战模型的鲁棒性。我们在32个数据集(覆盖42种语言)上评估了16个开源权重嵌入模型,变换经4800条英语子样本的人工评级验证。我们发现三个模式:(1)模型在不同轴线上表现出特定且部分独立的鲁棒性轮廓。(2)在三个模型家族中,规模增加绝对得分,但不会缩小原始评估与变换后评估之间的差距。此处,规模扩大主要改善语言轴线。(3)英语数据集对HTEB变换更敏感于多语言数据集。这表明HTEB识别模型在部署相关轴线上的优势与弱点,挑战当前的嵌入基准,主张采用多维、动态鲁棒性评估。

关键词

引用

@article{arxiv.2605.28190,
  title  = {The Harder Text Embedding Benchmark (HTEB): Beyond One-dimensional Static Robustness},
  author = {Manuel Frank and Haithem Afli},
  journal= {arXiv preprint arXiv:2605.28190},
  year   = {2026}
}

备注

29 pages, 11 figures