中文

超越已知事实:生成未见时间知识以解决 LLM 评估中的数据污染

机器人学 2026-01-21 v1 人工智能 机器学习 多智能体系统

摘要

信息的自动抽取对于填充如 Wikidata 等大型网络知识库非常重要。该任务的时间版本,即时间知识图谱抽取(TKGE),涉及从文本中抽取具有时间属性的事实,表示为语义四元组(主语、关系、宾语、时间戳)。许多最近的系统利用了大型语言模型(LLM),由于其在自然语言处理(NLP)领域众多任务上的表现,LLM 正在成为网络的新基石。尽管 TKGE 很重要,但现有的训练和评估数据集仍然稀缺,评估数据污染是一个未解决的问题,由于训练集和评估集之间的重叠,这可能会夸大 LLM 的感知性能。为了缓解这些挑战,我们提出了一个新颖的合成评估数据集,该数据集由预测的未来、未见时间事实构建,从而消除污染并实现稳健、无偏见的基准测试。我们的数据集创建包含两步方法:(1)时间知识图谱预测(TKGF)生成合理的未来四元组,随后进行过滤以符合原始知识库模式;(2)LLM 执行四元组到文本的生成,创建语义对齐的文本描述。我们对 Extract, Define and Canonicalize(EDC)这一最先进的基于 LLM 的抽取框架进行了基准测试,表明与已知事实数据集相比,LLM 在我们的数据集上评估时性能下降。我们公开发布了包含 4.2K 未来四元组及相应文本描述的数据集,以及生成方法,从而能够持续创建无限的未来时间数据集,作为 TKGE 长期、无污染的基准测试。

关键词

引用

@article{arxiv.2601.13657,
  title  = {Communication-Free Collective Navigation for a Swarm of UAVs via LiDAR-Based Deep Reinforcement Learning},
  author = {Myong-Yol Choi and Hankyoul Ko and Hanse Cho and Changseung Kim and Seunghwan Kim and Jaemin Seo and Hyondong Oh},
  journal= {arXiv preprint arXiv:2601.13657},
  year   = {2026}
}