面向文化情境任务的多模态LLM解释能力评估与提升的结构化框架
计算与语言
2026-02-03 v2
摘要
本研究旨在测试和评估当前主流视觉语言模型(VLM)在生成传统中国画 critique方面的能力。为实现此目标,我们首先开发了一个用于中国画 critique的量化框架。该框架通过从人类专家 critique中提取覆盖评估立场、特征关注和评论质量等多维度评估特征,构建零样本分类模型。基于这些特征,定义并量化了若干代表性的 critique人物。随后,我们运用该框架评估了Llama、Qwen、Gemini等选取的VLM。实验设计包含基于人物引导的提示,以评估VLM从多样化视角生成 critique的能力。我们的发现揭示了VLM在艺术 critique领域的当前性能水平、优势及改进方向,为理解其在复杂语义理解和内容生成任务中的潜力与局限提供了洞见。本实验使用的代码可公开访问于:https://github.com/yha9806/VULCA-EMNLP2025。
关键词
引用
@article{arxiv.2509.23208,
title = {A Structured Framework for Evaluating and Enhancing Interpretive Capabilities of Multimodal LLMs in Culturally Situated Tasks},
author = {Haorui Yu and Ramon Ruiz-Dolz and Qiufeng Yi},
journal= {arXiv preprint arXiv:2509.23208},
year = {2026}
}
备注
EMNLP 2025 submission, 10 pages, 6 figures, 5 tables