基于 RDF 的多语言 LLM 评估结构化质量评估表示
计算与语言
2025-05-01 v1 人工智能
信息检索
摘要
大型语言模型(LLM)日益用作知识接口,但系统性地评估其在存在冲突信息时的可靠性仍然困难。我们提出一种基于 RDF 的框架,用于评估多语言 LLM 的质量,聚焦于知识冲突。我们的methods 捕捉四种不同上下文条件(完整、不完整、冲突和无上下文信息)下模型的响应情况,涵盖德语和英语。这种结构化表示使我们能够全面分析知识泄漏——即模型倾向于优先于提供的上下文信息选择训练数据——以及跨语言的一致性。我们通过一个火灾安全领域的实验演示了该框架,揭示了上下文优先级和语言特定性能中的关键模式,证明了我们的词汇表足以表达 28 题研究中遇到的每一个评估方面。
引用
@article{arxiv.2504.21605,
title = {RDF-Based Structured Quality Assessment Representation of Multilingual LLM Evaluations},
author = {Jonas Gwozdz and Andreas Both},
journal= {arXiv preprint arXiv:2504.21605},
year = {2025}
}