zhengyun

zhengyun

@zhengyun · Twitter ·

美国人工智能标准与创新中心(CAISI)的2026年5月1日报告: “根据 DeepSeek 的数据,DeepSeek V4 的性能与大约两个月前发布的 Opus 4.6 和 GPT-5.4 相当。然而,CAISI 的评估(包括非公开基准测试)表明,DeepSeek V4 的性能与大约八个月前发布的 GPT-5 类似”。 CAISI 是什么? 它不是 LMSYS 那种“用户体验竞技场”,LMSYS的核心成果为 Chatbot Arena 大模型竞技评测平台,被业界视为全球大模型能力评估的风向标。 它更接近“面向国家标准的能力测量体系”,聚焦于能力是否可量化、是否可对比、是否可监管、是否可进入国家关键基础设施体系。 它测试的可能是: 1)长链推理(long-chain reasoning):如数学证明、复杂规划; 2)对齐(alignment):让模型“在复杂语境中不犯错”; 3)稳定性与泛化能力:对分布外问题不崩,输出一致性高。 这三类能力,本质上都是在用极高的成本换取极限能力和长尾可靠性。 毫无疑问,美国闭源大模型的超大规模算力投入(数十亿美金级别)、长周期训练、不以短期盈利为核心约束的资源禀赋,特别适合这种能力测试,如ARC-AGI-2 (抽象推理)、CTF-Archive (夺旗赛网络安全)、FrontierScience (前沿科学问题),无一不是对模型推理极限的严苛考验。这同时也符合美国模型的商业逻辑:“卖最强能力给最愿意付费的人”。 但中国开源大模型都不是这么设计和运行的。 美国在解的问题是:“模型能有多聪明?” 中国在解的问题是:“智能在社会中能被用到多大规模?” 美国希望寻求的答案是:“让模型更像博士。” 但中国更关注的答案是:“让模型变成基础设施,像水电气、医疗服务和云计算服务一样。” 总而言之,请记住两句话: 第一句话是,DeepSeek v4 在用户体验层面已经进入全球第一梯队,但在极限能力与可靠性层面仍落后;然而凭借其成本结构,使它在 Agentic 时代具备不对称竞争力。 第二句话是,CAISI 评测体系选择了一个美国已经投入了最多资源的测评子空间,本质上是用美国的标准和考卷,来衡量一个为不同目标而优化的学生,美国闭源模型大概率赢。

Post media