引入视觉场景与推理:一个更真实的口语理解基准
人工智能
2025-11-25 v1
摘要
口语理解(SLU)包含两个子任务:意图检测(ID)和槽填充(SF)。鉴于其广泛的实际应用,增强SLU以实现实际部署变得越来越重要。基于用户画像的SLU通过整合上下文感知(CA)、用户画像(UP)和知识图谱(KG)来解决模糊的用户表述,从而推动SLU研究走向实际应用。然而,现有的SLU数据集在表示真实场景方面仍有不足。具体而言,(1)CA使用独热向量表示,过于理想化;(2)模型通常仅关注预测意图和槽标签,忽略了可能提升性能和可解释性的推理过程。为克服这些局限性,我们引入了VRSLU,一个整合视觉图像和显式推理的新型SLU数据集。对于过于理想化的CA,我们使用GPT-4o和FLUX.1-dev生成反映用户环境和状态的图像,随后经过人工验证以确保质量。对于推理,使用GPT-4o生成预测标签的解释,然后由人工标注者完善以确保准确性和连贯性。此外,我们提出了一种指令模板LR-Instruct,它首先预测标签,然后生成相应的推理。这种两步方法有助于减轻推理偏差对标签预测的影响。实验结果证实了整合视觉信息的有效性,并突显了显式推理在推进SLU方面的前景。
引用
@article{arxiv.2511.19005,
title = {Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding},
author = {Di Wu and Liting Jiang and Ruiyu Fang and Bianjing and Hongyan Xie and Haoxiang Su and Hao Huang and Zhongjiang He and Shuangyong Song and Xuelong Li},
journal= {arXiv preprint arXiv:2511.19005},
year = {2025}
}