面向 MIPVU 框架下面向中文的 token 级隐喻识别的可复现多模型基线
计算与语言
2026-05-11 v1
摘要
隐喻在日常语言中广泛存在,但在 MIPVU 框架下进行 token 级中文隐喻相关词汇的计算识别仍不够探索。本文提出了一个面向 PSU 中文隐喻语料库(PSU CMC)的可复现多模型基线,该语料库是唯一广泛可获取的 MIPVU 标注中文语料。我们系统比较了三类模型:(i)基于中文 RoBERTa-wwm-ext-large 的编码器微调;(ii)使用新建的基于现代汉语词典(第 7 版,MCD7)中 74,823 个词条(覆盖 71.51% PSU CMC 词汇)构建的基础语义资源,适用于 MelBERT;(iii)使用 QLoRA 微调的 Qwen3.5-9B 作为指令调优生成式基线。经过五个固定随机种子测试,MelBERT MIP-only 在测试正 F1 上 achieves 最强表现为 0.7281 ± 0.0050,略高于 MelBERT Full(0.7270 ± 0.0069)和明显高于普通 RoBERTa(0.7142 ± 0.0121)。Qwen QLoRA 生成式配置比编码器基线低约 11 分(0.6157 ± 0.0113)。值得注意的三个发现包括:(1)MelBERT 的 SPV 通道在中文中未提供可靠的正向信号,这与传统隐喻占主导地位相符;(2)Qwen 编码器之间的差距集中在召回率,这反映了生成式输出的离散承诺限制;(3)若干 Qwen 任务形式因格式设计而非模型容量而失败。我们发布了所有数据分割清单、每个随机种子的输出、MCD7 基础语义嵌入管道以及训练脚本,以作为未来中文隐喻识别研究的通用参考。
引用
@article{arxiv.2605.07170,
title = {A Reproducible Multi-Architecture Baseline for Token-Level Chinese Metaphor Identification under the MIPVU Framework},
author = {Yufeng Wu},
journal= {arXiv preprint arXiv:2605.07170},
year = {2026}
}