
商业 · zh
中美开源模型大会师:Kimi、Qwen、DeepSeek、Meta和英伟达五模大横评
开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5 Lightning。 如此盛况,那可就必须把五个模型接进同一个测试环境测一测,是骡子是马拉出来遛遛。 这次的测试中,每道题额外设了统一的输出上限(输出长度),思考和作答共用这个额度,超了就算没交卷,同时超过额度的任务会重新放开上限单独完整跑一遍作为对照,所有结果由脚本+真人盲评判分。 先直接上成绩:绿格最多的是K3,十项里六项满分,DeepSeek排第二。需要注意的是表里的0分,部分是因为模型思考太长被截断,没有完整输出,后文有具体解释。…





