中文

面向高级多模态个性化研究的基准与知识 grounding 框架

计算机视觉与模式识别 2026-02-24 v1

摘要

现代视觉语言模型的强大推理能力为高级个性化研究开辟了新前沿。然而,该领域的进展严重受限于缺乏合适的基准测试。为填补这一空白,本文引入 Life-Bench,一个构建于模拟用户数字足迹上的综合性、合成生成的多模态基准测试。Life-Bench 包含超过问题,评估从人格理解到对历史数据进行复杂推理的广泛能力。这些能力远超先前的基准测试,反映了对现实应用至关重要的关键需求。此外,我们提出 LifeGraph,一个将个人上下文组织为知识图谱以促进结构化检索和推理的端到端框架。我们的实验在 Life-Bench 上表明,现有方法在复杂个性化任务上表现显著不足,尤其在关系、时间和聚合推理方面存在大幅性能提升空间。虽然 LifeGraph 通过利用结构化知识弥合了这一差距并展示了有前景的方向,但这些高级个性化任务仍然是一个关键的开放挑战,这激励了该领域新的研究。

关键词

引用

@article{arxiv.2602.19001,
  title  = {A Benchmark and Knowledge-Grounded Framework for Advanced Multimodal Personalization Study},
  author = {Xia Hu and Honglei Zhuang and Brian Potetz and Alireza Fathi and Bo Hu and Babak Samari and Howard Zhou},
  journal= {arXiv preprint arXiv:2602.19001},
  year   = {2026}
}