返回博客

监管盯着一个正在消失的瞬间——当模型每天都在变,"发布前检查"还能检查什么

AI监管持续学习政策Dwarkesh竞争

八月七号,Dwarkesh Patel 发了八条预测。

他是那个把 Ilya、Karpathy——真正在造这些模型的那批人——一个个请到播客上,一聊就是三个小时的年轻人。八条预测讲的都是"持续学习时代"——模型不再是训练完就定型,而是每天根据它干过的几百万次活继续变。

第一条就把 AI 监管的地基拆了。

所有监管长的都是同一个样子

你去翻现在世面上的 AI 监管方案,欧盟的、美国各州的、国内的,形状惊人地一致。

它们都假设一条流水线:先训练一个模型,训练完,部署出去。

这条流水线中间有一道缝。缝的两边,一边是"还没出去",一边是"已经出去了"。监管站在这道缝上,在模型出去之前跑一堆检查——能不能被用来搞网络攻击,会不会递归地改进自己,有没有别的谁也说不清但听着就危险的能力。

过了检查,放行。没过,回去改。

这个设计不蠢。它抄的是药品和飞机的作业。药上市前要过临床,飞机交付前要适航审定,都是在一个明确的时间点上,对一个已经定型的东西做一次性判断。

前提是那个东西真的定型了。

缝要没了

持续学习之下,基础模型每天都在根据几百万个 session 更新。

Dwarkesh 的原话是,未来"部署"不会再是一个有意义的独立类别。

这句话我想了一会儿。它的意思不是监管太松或者太严,是监管瞄准的那个东西——那个"发布时刻"——正在从物理上消失。

不是变难了。是不存在了。

你没法在一条连续的曲线上找出"发布前"和"发布后"。药审能成立,是因为这批药出厂之后化学式不会自己变。飞机适航能成立,是因为交付之后机翼不会自己长。

模型会。

它今天通过了你的全部检查,明天吸收了一千万次对话,后天的它跟你检查过的那个已经不是同一个东西了。你手里那张合格证,证明的是一个不再存在的对象。

他的药方跟他的诊断打架

这里是我觉得他没想透的地方。

诊断完之后,Dwarkesh 给的替代方案是:把风险检查变成月度或者季度的例行动作。

我读到这儿停下来了。

如果诊断是"检查点这个形式失效了",那药方不该是"多做几次检查点"。

季度检查是什么?就是把同一个失效的动作,从"部署前那一次"改成"每三个月一次"。错配没有被解决,只是被切成了四份。模型在两次检查之间照样每天变,你在四月一号发的那张证,到四月二号就已经过期了——只不过这回你自己知道它过期,上一版你还以为它有效。

检查点这个形式,依赖的是"存在一个可以被拿住的静止状态"。

持续学习拿掉的就是静止状态。

频率救不了这个。

你把季度改成每周、改成每天,都救不了,因为问题不在采样有多密,在于你测的始终是一个快照,而真正要防的那些东西是长在变化的过程里的,不长在任何一张快照上。

真要接着往下想,方向大概是从"查状态"换成"查变化"——不问它现在是什么样,问它这一周往哪个方向走了、走了多远、有没有越过某条线。这需要的是持续接进去的监测,不是定期发的证。

具体怎么做,我不知道。我只是觉得,把"发证"这个动作保留下来、只是加快频率,是在给一个已经拆掉的地基刷漆。

"再等等"从来不是一句中立的话

Dwarkesh 那八条里,还有几条我建议放在一起读。

第四条:领先的模型会靠积累的部署经验越滚越快。第六条:持续学习会造出换供应商的成本,谁先跑起来谁就一直领先。第七条:用户和企业得在"别被锁死"和"用上更强的东西"之间选。第八条:个性化权重的推理成本结构,利好那些能产生足够并发流量的大机构。

四条话说的是同一件事。

这套东西会让大的更大,而且是结构性的,不是谁运气好:用户多的那家每天喂进去的真实工作就多,模型因此变得更好用,更好用又吸引来更多用户,这个转法从第一天起就不对称,越转越不对称。

然后第一条说:现在别急着定监管,我们不知道一年后技术长什么样。

两句话分开看都对。放一起就有问题了。

因为"等技术清楚了再定规矩"这句话,从来不是中立的。等待期不是空白期。等待期里发生的事,正是第四、六、七、八条描述的那件事:领先的那几家把差距拉开,换供应商的成本堆高,能吃并发流量的大机构把小的挤出去。

等到"部署"真的不再是一个有意义的类别的时候,"竞争"可能也不是了。

到那时候再来定规矩,坐在桌子边上的,就是这段等待期里长得最快的那两三家。他们不是被监管的对象,他们是规矩的合著者。

这话不新鲜。

每一轮都这样。金融是这样,电信是这样,平台经济也是这样——规矩总是在格局定下来之后才写,写的时候,能进屋的人已经筛过一遍了。

这不是说 Dwarkesh 有什么私心。他讲的是技术判断,而且技术判断是对的。

我想说的只是:一个技术上正确的建议,落到时间轴上,是会有分配后果的。谁受益,可以直接算出来——第八条已经替我们算了。

我不确定的部分

我不确定的是,另一条路是不是更糟。

现在就把规矩定死,定的还是"发布前检查"那一套,那就是把一个已经错了的形式浇成水泥。三年后所有人都在绕开它,合规变成一场大家心照不宣的表演——这种事我们见得不少了。

所以 Dwarkesh 那句"我们不知道一年后是什么技术",作为一句警告是成立的。

它不成立的地方在于被当成结论用。

"不知道未来"能推出的是"别把规矩写死",推不出"现在什么都别做"。这两件事差得很远。你可以现在就要求持续的监测接口、要求变化留痕、要求实验室对模型这个月往哪走给出说明——这些都不需要你预知一年后的技术长什么样。

需要预知未来的,恰恰是"发布前检查"那种一次性判断。

最后一件事

八条预测里最容易被读过去的是第三条:模型会因为跟不同的人学,而变得越来越不一样。

同一个厂的同一个型号,装在两家公司里,跑上一年,会长成两个东西。

监管现在管的对象叫"模型"。如果第三条成真,那"模型"这个词指的是什么,本身就要重新想——你批准的是哪一个?

我猜没人准备好回答这个。反正我没有。