中文

LeCov: 大语言模型的多层测试准则

软件工程 2024-08-21 v1 人工智能 计算与语言 密码学与安全 机器学习

摘要

大语言模型(LLMs)广泛应用于众多不同领域,但由于其可解释性有限,人们从多个角度质疑其可信度,例如真实性和毒性。近期研究已开始开发LLM的测试方法,旨在在部署前揭示不可信问题,即缺陷。然而,系统化和形式化的测试准则仍然缺乏,这阻碍了对测试探索范围和充分性的全面评估。为缓解这一威胁,我们为LLM提出了一套多层测试准则LeCov。该准则考虑了LLM的三个关键内部组件,即注意力机制、前馈神经元和不确定性,共包含九种类型的测试准则。我们在两种场景中应用这些准则:测试优先级排序和覆盖引导测试。在三个模型和四个数据集上的实验评估证明了LeCov的有用性和有效性。

关键词

引用

@article{arxiv.2408.10474,
  title  = {LeCov: Multi-level Testing Criteria for Large Language Models},
  author = {Xuan Xie and Jiayang Song and Yuheng Huang and Da Song and Fuyuan Zhang and Felix Juefei-Xu and Lei Ma},
  journal= {arXiv preprint arXiv:2408.10474},
  year   = {2024}
}