基于领域的 LLM 在国际学生知识领域的评估
人机交互
2025-11-27 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 越来越多地被用于回答关于入学、签证、奖学金和资格的高风险海外学习问题。然而,如何可靠地建议学生,以及 otherwise 有帮助的答案多 Often drifts into unsupported claims(“幻觉”)仍不明确。本工作提供了关于当前 LLM 在此场景下行为的清晰、基于领域的概览。使用真实问题构成的问答集,源自 ApplyBoard 的咨询工作流程——一个支持学生从发现到入学的教育科技平台——我们评估两个核心要素:准确性(信息是否正确且完整?)和幻觉(模型是否添加了不受问题或领域证据支持的内容)。这些问题按领域范围进行分类,可为单一领域或多领域——当必须整合诸如入学、签证和奖学金等领域的证据时。为反映真实咨询质量,我们采用简单的评分标准,对答案进行正确、部分或错误等级。该评分标准具有领域覆盖 awareness:答案若仅解决子集所需领域,即可为部分;若引入额外、不必要的领域,也可计为过度覆盖;这两种模式在我们的评分中均被记录为 under-coverage 或 reduced relevance/幻觉。我们还报告忠实度和答案相关性的指标,以及综合幻觉得分,以捕捉相关性和实用性。所有模型均使用相同的问答集进行测试,以保证公平的头盼比较。我们的目标是:(1)为哪些模型在海外学习咨询中最可靠提供清晰图景,(2)暴露常见的失败模式——答案不完整、偏离主题或不受支持,以及(3)为教育和咨询语境中的 LLM 审计提供实用、可复用的协议。
引用
@article{arxiv.2511.20653,
title = {Domain-Grounded Evaluation of LLMs in International Student Knowledge},
author = {Claudinei Daitx and Haitham Amar},
journal= {arXiv preprint arXiv:2511.20653},
year = {2025}
}