语言模型在开放世界组合零样态学习中的可行性研究
人工智能
2025-05-19 v1
摘要
人类可以轻易判断某种属性(也称为状态)是否为对象的真实属性,例如燃烧可以使物体变热,但不能使其变湿。在开放世界组合零样态学习中,当将所有可能的状态-对象组合视为未见类别时,零样态预测器倾向于表现不佳。我们的工作聚焦于利用外部辅助知识来确定状态-对象组合的可行性。我们的可行性语言模型(Feasibility with Language Model, FLM)是一种简单且有效的方法,利用大型语言模型(LLM)更好地理解状态与对象之间的语义关系。FLM通过查询LLM关于给定配对的可行性并检索正面答案的输出logit来实现。为缓解许多状态-对象组合罕见或完全不可行导致LLM可能误导的问题,我们观察到LLM的基于上下文的学习能力至关重要。我们进行了广泛的研究,确定Vicuna和ChatGPT表现最佳,并展示了我们的FLM在所有三个基准测试中均一致改进了开放世界组合零样态学习(OW-CZSL)性能。
引用
@article{arxiv.2505.11181,
title = {Feasibility with Language Models for Open-World Compositional Zero-Shot Learning},
author = {Jae Myung Kim and Stephan Alaniz and Cordelia Schmid and Zeynep Akata},
journal= {arXiv preprint arXiv:2505.11181},
year = {2025}
}
备注
ECCV Workshop in OOD-CV, 2024