中文

机器生成的产品广告:基准测试LLM与人类性能

计算与语言 2024-12-30 v1

摘要

本研究比较了AI生成和人类编写的产品描述的性能,使用多层次评估模型。我们分析了为100个产品由四个AI模型(Gemma 2B、LLAMA、GPT2和ChatGPT 4)生成的描述,这些模型分别带和不带示例描述,针对人类编写的描述进行评估。我们的评估指标包括情感、可读性、说服力、搜索引擎优化(SEO)、清晰度、情感吸引力以及行动号召效果。结果表明,ChatGPT 4性能最佳。相比之下,其他模型表现出显著的不足,产生不连贯且毫无逻辑的输出,缺乏逻辑结构和上下文相关性。这些模型在保持对所描述产品的关注方面存在挑战,导致句子不连贯,无法传递有意义的信息。该研究为了解AI在电子商务内容创建方面的当前能力和局限性提供了见解。

关键词

引用

@article{arxiv.2412.19610,
  title  = {Machine Generated Product Advertisements: Benchmarking LLMs Against Human Performance},
  author = {Sanjukta Ghosh},
  journal= {arXiv preprint arXiv:2412.19610},
  year   = {2024}
}