中文

基于 RDF 的多语言 LLM 评估结构化质量评估表示

计算与语言 2025-05-01 v1 人工智能 信息检索

摘要

大型语言模型(LLM)日益用作知识接口,但系统性地评估其在存在冲突信息时的可靠性仍然困难。我们提出一种基于 RDF 的框架,用于评估多语言 LLM 的质量,聚焦于知识冲突。我们的methods 捕捉四种不同上下文条件(完整、不完整、冲突和无上下文信息)下模型的响应情况,涵盖德语和英语。这种结构化表示使我们能够全面分析知识泄漏——即模型倾向于优先于提供的上下文信息选择训练数据——以及跨语言的一致性。我们通过一个火灾安全领域的实验演示了该框架,揭示了上下文优先级和语言特定性能中的关键模式,证明了我们的词汇表足以表达 28 题研究中遇到的每一个评估方面。

关键词

引用

@article{arxiv.2504.21605,
  title  = {RDF-Based Structured Quality Assessment Representation of Multilingual LLM Evaluations},
  author = {Jonas Gwozdz and Andreas Both},
  journal= {arXiv preprint arXiv:2504.21605},
  year   = {2025}
}