探索与测试基于技能的行为概要注释:人类可操作性与LLM可行性于模式导向执行下
计算与语言
2026-04-17 v1
摘要
行为概要(BP)注释因需要同时跨多个语言维度编码而难以自动化。我们将BP注释视为一组注释技能而非单一任务,从该视角评估LLM辅助BP注释的可行性。使用3,134行30个中文隐喻色词派生语料和14特征BP模式,我们实现了一个由技能文件驱动的管道,其中每个特征通过模式文件、决策规则和示例外部定义。两位人类注释者在300个实例的验证子集上完成了两轮仅用模式的协议,使BP技能可被分类为直接可操作、可在聚焦重注释后恢复或结构不确定。GPT-5.4和三个可本地部署的开源模型随后在相同设置下进行评估。结果表明,BP在技能层面高度异质:5个技能直接可操作,4个可在聚焦重注释后恢复,5个仍结构不确定。GPT-5.4在保留技能方面表现出显著可靠性(准确率=0.678, κ=0.665,加权F1=0.695),但这种可行性是选择性的而非全局的。人类和GPT在技能层面难度轮廓高度一致(r=0.881),但在实例层面(r=0.016)或词汇项目层面(r=-0.142),一种我们描述为共享分类、独立执行的模式。成对一致性进一步表明,GPT更应被理解为独立的第三方技能声音而非直接的人类替代品。开源模型的失败集中在模式到技能执行问题上。这些发现表明,自动化注释应以技能可行性而非任务水平自动化来评估。
引用
@article{arxiv.2604.14843,
title = {Exploring and Testing Skill-Based Behavioral Profile Annotation: Human Operability and LLM Feasibility under Schema-Guided Execution},
author = {Yufeng Wu},
journal= {arXiv preprint arXiv:2604.14843},
year = {2026}
}