FireTofu
大模型越烧钱,AI 研究为什么反而迎来“小机构窗口”?

科学 · zh

大模型越烧钱,AI 研究为什么反而迎来“小机构窗口”?

虎嗅 · 2026年8月29日 16:06 UTC

今年8月,独立AI评测机构METR说,过去半年里,它获得了约7100万美元的资金承诺。 METR不训练基础模型,没有数据中心,也没有一款等待冲上应用榜的聊天产品。它做的是另一件听起来不那么热闹的事:让模型做一批尽量接近真实工作的任务,记录它用了哪些工具、在哪一步卡住、能连续完成多长时间的工作,再把方法和结果放出来。 为什么一群最有钱、最会造模型的公司旁边,会需要这样一家机构? 一个模型能写出不错的代码,和它能否在没有人盯着的情况下跑完一个两小时的工程任务,是两回事。一个Agent演示里会订机票,和它在真实权限、真实网站、真实异常里能否稳定完成任务,也是两回事。模型公司当然会做内部测试,但当测试结果关系到发布节奏、销售承诺和监管压力时,外面总要有人再量一次。…

科学 · 虎嗅

AI可解释性与对齐:J-Space,思维链,AI人格,幻觉,与金门大桥

如今的AI仍然是一个黑箱,我们知道如何训练模型,如何让它变得越来越聪明,也知道它最终给出了什么答案。但在输入和输出之间究竟发生了什么,我们仍然知之甚少。 试图打开这个黑箱、理解模型内部究竟发生了什么,正是可解释性研究(AI interpretability)希望解决的问题。过去几年,这个领域确实出现了不少令人兴奋的进展。…
阅读原文 ↗