
科学 · zh
大模型越烧钱,AI 研究为什么反而迎来“小机构窗口”?
今年8月,独立AI评测机构METR说,过去半年里,它获得了约7100万美元的资金承诺。 METR不训练基础模型,没有数据中心,也没有一款等待冲上应用榜的聊天产品。它做的是另一件听起来不那么热闹的事:让模型做一批尽量接近真实工作的任务,记录它用了哪些工具、在哪一步卡住、能连续完成多长时间的工作,再把方法和结果放出来。 为什么一群最有钱、最会造模型的公司旁边,会需要这样一家机构? 一个模型能写出不错的代码,和它能否在没有人盯着的情况下跑完一个两小时的工程任务,是两回事。一个Agent演示里会订机票,和它在真实权限、真实网站、真实异常里能否稳定完成任务,也是两回事。模型公司当然会做内部测试,但当测试结果关系到发布节奏、销售承诺和监管压力时,外面总要有人再量一次。…





