行动链:通过大语言模型实现忠实且多模态的问答
计算与语言
2025-02-24 v2
摘要
我们提出了一个用于多模态和检索增强问答(QA)的行动链(CoA)框架。与现有文献相比,CoA 克服了当前 QA 应用的两大主要挑战:(i) 与实时或领域事实不一致的不忠实幻觉,以及 (ii) 对组合信息的弱推理能力。我们的核心贡献是一种新颖的推理-检索机制,通过系统化提示和预先设计的行动,将复杂问题分解为推理链。在方法论上,我们提出了三种领域可适应的“即插即用”行动类型,用于从异构源检索实时信息。我们还提出了一个多参考忠实度分数(MRFS)来验证并解决答案中的冲突。在实证方面,我们利用公开基准测试和一个 Web3 案例研究,展示了 CoA 相较于其他方法的能力。
引用
@article{arxiv.2403.17359,
title = {Chain-of-Action: Faithful and Multimodal Question Answering through Large Language Models},
author = {Zhenyu Pan and Haozheng Luo and Manling Li and Han Liu},
journal= {arXiv preprint arXiv:2403.17359},
year = {2025}
}
备注
International Conference on Learning Representations (ICLR) 2025