中文

LETToT:基于专家树状推理的大型语言模型旅游领域标签-free 评估框架

计算与语言 2025-08-26 v2 人工智能

摘要

在特定领域如旅游中,对大型语言模型(LLMs)进行评估仍面临标注基准成本高昂且存在幻觉等持续问题的挑战。我们提出可变更标签的大型语言模型旅游评估框架——基于专家树状推理(Label-Free Evaluation of LLM on Tourism using Expert Tree-of-Thought, LETToT)。该框架利用专家构建的推理结构(而非标注数据)来访问 LLMs 在旅游领域的表现。首先,我们通过与通用质量维度的对齐以及专家反馈,不断细化和验证层次化树状推理组件。结果表明,系统优化后的专家树状推理相较于基线实现了 4.99-14.15% 的相对质量提升。其次,我们将LETToT的优化专家树状推理应用于评估规模不同的模型(参数量从 32B 到 671B),发现:(1)在专业领域仍存在规模效应(DeepSeek-V3 领先),但推理增强的较小模型(如 DeepSeek-R1-Distill-Llama-70B)可缩小这一差距;(2)对于参数不足 72B 的模型,显式推理架构在准确率和简洁性方面显著优于其它模型(p<0.05p<0.05)。我们的工作建立了可扩展、标签-free 的领域特定 LLM 评估范式,为常规标注基准提供了稳健的替代方案。

关键词

引用

@article{arxiv.2508.11280,
  title  = {LETToT: Label-Free Evaluation of Large Language Models On Tourism Using Expert Tree-of-Thought},
  author = {Ruiyan Qi and Congding Wen and Weibo Zhou and Jiwei Li and Shangsong Liang and Lingbo Li},
  journal= {arXiv preprint arXiv:2508.11280},
  year   = {2025}
}