中文

将文本嵌入嵌入化于利益相关者关联中

计算与语言 2026-05-27 v1 人工智能 计算机与社会

摘要

文本嵌入广泛用于分析复杂文本大型语料库。然而,是否清楚这些嵌入捕获了人类专家使用的相同语义距离仍不明确。确保嵌入表示与人类意图之间保持对齐对于有效分析至关重要。我们提出了利益相关者嵌入练习, 一种使专家关联变得明确并将嵌入模型结果锚定在人类理解中的方法。在关于丹麦政策问题的主要案例研究中, 我们发现神经文本嵌入的可靠性显著低于人类专家(间隔 19-26 个百分点), 且这种错位会传播到下游聚类性能(练习排名与聚类质量之间的斯佩尔 ρ=0.9\rho=0.9)。在美国联邦 AI 用例的二次研究中, 使用数字程序和不同的专家群体以复制错位(16 个百分点), 以英文进行, 以证明该错位并非单一仪器或领域的副作用。利益相关者嵌入练习提供了一种实用方法, 用于评估嵌入模型是否捕获最能关乎领域专家的语义区别。

关键词

引用

@article{arxiv.2605.27168,
  title  = {Grounding Text Embeddings in Stakeholder Associations},
  author = {Jonathan Rystrøm and Sofie Burgos-Thorsen and Zihao Fu and Johan Irving Søltoft and Kenneth C. Enevoldsen and Chris Russell},
  journal= {arXiv preprint arXiv:2605.27168},
  year   = {2026}
}