中文

X-SYNTH: Beyond Retrieval -- Enterprise Context Synthesis from Observed Digital Human Attention

人工智能 2026-05-22 v2 信息检索 机器学习

摘要

在企业运营中,AI智能体任务所需的上下文分散存储在系统记录、静态信息存储库和通信频道中。已存储的内容是系统状态,对实际发生的工作的损失表示。主流方法通过匹配请求内容与存储内容进行检索;对于狭窄请求效果良好。但合成质量取决于知道要呈现什么内容以及如何解释它:特定于每个组织、团队和个人的知识,存在于行为模式中,不存在于任何检索索引中。对于提出企业价值 leads 给 sellers 的 agentic task 而言,这种方法会失败:True Lead Rate 低,False Lead Rate 高,且模型没有改进的机制。我们提出X-SYNTH,基于数字人类注意力的企业上下文合成框架,数字人类注意力是每个 worker 可观测的交互签名,编码他们做了什么、以何种顺序做以及隐式奖励信号。未伴随正面结果的行为痕迹可被区分于未伴随结果的痕迹,无需外部标记。X-SYNTH 将每个人的行为基线建模为 Digital Twin Signature(DTS),并针对每个人和每个查询选择七种注意力过滤器:比例(Proportional)、逆向(Inverse)、差分(Differential)、循环(Recurrent)、比较(Comparative)、顺序(Sequential)和集体(Collective),以识别因果相关活动签名。一个四阶段 pipeline 将基于行为模式而非查询嵌入构建排名靠前的上下文。一个 frontier model unaided 实现 9.5% 的 True Lead Rate(TLR),且 False Lead Rate 为 90.5%。增强后,TLR提升至61.9%(6.5倍),FLR降至18.8%。企业上下文合成不是检索问题。它是一个相关性问题,数字人类注意力是其最可靠的 ground truth。

关键词

引用

@article{arxiv.2605.15505,
  title  = {X-SYNTH: Beyond Retrieval -- Enterprise Context Synthesis from Observed Digital Human Attention},
  author = {Guruprasad Raghavan and George Nychis and Rohan Narayana Murthy},
  journal= {arXiv preprint arXiv:2605.15505},
  year   = {2026}
}

备注

11 pages, 7 figures, 5 tables