TEA-Bench:工具增强型情感支持对话智能体的系统性基准测试
人工智能
2026-05-11 v2
摘要
情感支持对话不仅需要情感表达,还需要基于事实的工具支持以提供可靠的指导。然而,现有的 ESC 系统和基准主要关注纯文本设置下的情感支持,忽略了外部工具如何在多轮情感支持中实现事实锚定并减少幻觉。我们引入了 TEA-Bench,这是首个用于评估工具增强型 ESC 智能体的交互式基准,具有真实的情感场景、MCP 风格的工具环境以及联合评估情感支持质量和事实锚定的过程级指标。在九个 LLM 上的实验表明,工具增强通常能提高情感支持质量并减少幻觉,但收益在很大程度上取决于模型能力:较强的模型更有选择性地、更有效地使用工具,而较弱的模型获益甚微。我们进一步发布了 TEA-Dialog,一个工具增强型 ESC 对话数据集,并发现监督微调改善了分布内支持,但泛化能力较差。我们的结果强调了工具使用在构建可靠情感支持智能体中的重要性。我们的代码和数据可在 https://github.com/XingYuSSS/TEA-Bench 找到。
引用
@article{arxiv.2601.18700,
title = {TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent},
author = {Xingyu Sui and Yanyan Zhao and Yulin Hu and Jiahe Guo and Weixiang Zhao and Bing Qin},
journal= {arXiv preprint arXiv:2601.18700},
year = {2026}
}