中文

REAL:面向住房交易与服务的大语言模型能力基准测试

人工智能 2025-07-08 v1

摘要

大语言模型的发展极大地推动了聊天机器人在多个领域的进步。目前迫切需要评估大语言模型是否能够像人类一样在住房交易和服务中扮演智能体的角色。我们提出了房地产智能体大语言模型评估(REAL),这是首个旨在评估大语言模型在住房交易和服务领域能力的评估套件。REAL 包含 5,316 个高质量评估条目,涵盖 4 个主题:记忆、理解、推理和幻觉。所有这些条目被组织成 14 个类别,以评估大语言模型是否具备住房交易和服务场景中的知识和能力。此外,REAL 被用于评估最先进的大语言模型的性能。实验结果表明,大语言模型在应用于房地产领域方面仍有显著的改进空间。

关键词

引用

@article{arxiv.2507.03477,
  title  = {REAL: Benchmarking Abilities of Large Language Models for Housing Transactions and Services},
  author = {Kexin Zhu and Yang Han},
  journal= {arXiv preprint arXiv:2507.03477},
  year   = {2025}
}