一项发表于《科学报告》的大规模人机对照研究,集齐10 万名普通人与 9 款主流大模型完成同一套发散联想创造力测试(DAT),给 AI 创造力争议交出一份量化答卷。结果极具反差:GPT‑4 平均分已经超过人类平均水平,但人类前 10% 顶尖创意人群,依然甩开全部被测 AI 模型。这一结论,重新定义了当下我们对机器创造力的认知边界。
本次研究采用 DAT 发散联想任务:要求参与者 4 分钟写出 10 个语义尽可能互不相关的名词,依靠算法计算词语之间语义距离,实现客观自动打分,规避人工评审主观偏差。参与测试模型包含 GPT‑3.5、GPT‑4、GPT‑4‑turbo、Claude3、Gemini Pro 以及多款开源大模型。
核心实验结果: ✅ GPT‑4 常规设置下平均分超过人类平均;调高温度参数后,得分可以超过 72% 人类受试者;Gemini Pro 成绩与人类均值持平,其余多数模型低于人类平均水平。 ❌ 人类前 50% 群体平均分,依旧高于全部 AI;排名前 10% 的顶尖人类,大幅拉开与所有模型的差距。AI 分数高度集中在狭窄区间,很难触达人类高分段;即便是写诗、写微型小说的创作任务,顶尖人类作品质量依然占优。
有意思的是,新版本未必更强,GPT‑4‑turbo 得分反而低于 GPT‑4,证明模型规模、版本迭代并不直接等价于发散创造力提升。同时模型表现受外部条件影响巨大:调高采样温度、优化提示词,都可以明显拉高 AI 的创意输出水平,提示工程本身已经成为创作流程的一环。
这项实验只衡量发散联想能力,不等于完整创造力。真正的创造力同时要求 “新颖” 与 “实用”,这套测验只能衡量联想发散度,无法评判想法落地价值,存在天然边界。
研究也暴露出大模型的共性短板:
输出趋同问题突出:不同大模型生成答案相似度远高于人与人之间,AI 容易落入统计上的安全区间,缺少人类个体的参差多样性。
训练集数据污染风险:该测验网络公开,无法排除模型在训练阶段见过同类题目。
测试条件会改变结果:有复现实验证明,给人类增加思考时间、写清题目说明,人类成绩就可以大幅追平 AI。
只测语言联想,不包含动机、体验、现实问题解决等完整创意链条。
实验结果打破两种极端幻想:既不能神话 AI “创造力超越人类”,也不能全盘否定大模型的创意能力。
从产业视角看,AI 已经具备很强的创意打底能力,可以高效产出大量备选方案,拉低创意行业入门门槛,成为普通从业者强大辅助工具。但在追求突破性、高度差异化的顶尖创作场景,当前模型仍存在明显天花板。
不少研究者提出新的协作思路:不必纠结 “人还是 AI 更强”,转向人机协同模式。AI 负责批量发散、提供备选素材,人类完成价值判断、方向取舍与深度打磨,把机器作为创意放大器,而不是完全替代创作者。
这项十万级样本研究最重要的启示:AI 打赢平均数,人类守住创造力上限。标准化测试分数不等于真实世界创新能力。未来创意产业的竞争,不是人和机器比拼联想做题,而是人如何善用工具,保留独属于人类的独特视角、动机与价值判断。
风险提示:本文仅解读学术实验,不构成行业、投资建议。
需要我帮你生成配图描述,或者提供多组备选标题、Word 复制排版版本吗?