中文

检测大语言模型中的编辑失败:一种改进的具体性基准

计算与语言 2023-06-06 v2 人工智能 机器学习

摘要

近期的模型编辑技术有望缓解LLM训练期间记忆错误或过时关联的问题。然而,我们表明这些技术会引入现有具体性基准无法检测到的巨大非预期副作用。我们将现有的CounterFact基准扩展为包含动态组件,并称之为CounterFact+。此外,我们通过一种基于KL散度的原则性度量扩展了用于测量具体性的指标。我们使用这一改进基准评估了近期的模型编辑技术,发现它们存在低具体性问题。我们的发现凸显了需要改进的具体性基准以识别并防止非预期副作用。

关键词

引用

@article{arxiv.2305.17553,
  title  = {Detecting Edit Failures In Large Language Models: An Improved Specificity Benchmark},
  author = {Jason Hoelscher-Obermaier and Julia Persson and Esben Kran and Ioannis Konstas and Fazl Barez},
  journal= {arXiv preprint arXiv:2305.17553},
  year   = {2023}
}

备注

To be published in ACL Findings 2023; for code see https://github.com/apartresearch/specificityplus; for a homepage see https://specificityplus.apartresearch.com/; updated Figures to uniform style