这两天有条消息转得很凶。哈佛和 MIT 牵头,拉上 OpenAI、Anthropic、微软、Meta 的研究者,造了 83 亿个 AI 人格。标题都说这是《黑客帝国》成真,全球人口一比一镜像。
论文我翻了一遍。有一个数字,几乎所有转发都没提。
999,847。
这是他们真正公开放出来的人格数量。差不多 100 万条。不是 83 亿。
先说清楚 83 亿是怎么来的。
论文给每个虚拟人定义了 1290 个属性:国家、母语、学历、职业、收入、性格、平时用什么设备。然后用一张依赖关系图去采样。意思是属性之间有先后。先定地区和母语,再定英语水平。先定学历和职业,再定收入区间。采样出不合理的组合会被规则扔掉,比如肯尼亚农村、小学学历、哈佛博士、年入百万。
这套方法能生成的组合上限,就是 83 亿。跟地球人口对上,是因为他们想让它对上。不是因为真的有 83 亿份数据。
真正被质检过、被公开出来能用的,是那 100 万条。其中 40 万条是纯生成的。另外 60 万条,论文里标着「human-grounded」,意思是有真实数据打底。
这 60 万条值得单独看一眼。
论文附录里把来源和条数都列了,我抄一下。
维基百科人物传记,32.3 万条。Stack Overflow 开发者调查,11.3 万条。亚马逊购物评论记录,9.8 万条。General Social Survey,6.35 万条。PRISM 对齐数据集,1487 条。研究团队自己招志愿者填的问卷,355 条。加起来正好是 59.98 万。
最大的一块是维基百科。能在维基百科上有个人词条的,本身就不是普通人。
这个偏差可以量化。今年 7 月的统计,英文维基百科上有 214 万条人物词条,其中写女性的 43.6 万条,占 20.4%。真实世界里这个比例大约是一半。这不能怪维基百科,它记录的本来就是「被记录下来的人」。但你把它当人口样本用,性别比一上来就偏了两倍多。
第二块是 Stack Overflow 上愿意填年度调查的开发者。第三块是会在亚马逊上认真写评论的人。
六个来源里,真正按人口学抽样、能代表一个国家普通人的,只有 General Social Survey 那 6.35 万条。这是芝加哥大学做了五十多年的社会调查,抽样方法很正。但它只调查美国。
所以这件事可以这么说:
83 亿是组合数学。
60 万是真实数据。
6.35 万是按人口抽样的真实数据,而且只有美国那一份。
另一个转得很广的数字是 91.5%。原文的意思是这样。他们做了 400 次受控实验。其中 366 次,AI 表现出了它被分配的那个人设特征。或者该收着的时候正确收住了。
这个数字本身很扎实。但它测的是「演员有没有按剧本演」,不是「剧本像不像真人」。这两件事差得很远。
我给一个虚拟人设定「50 岁、保守、内向、住在美国中西部」。AI 演出来确实内向,确实保守。这就通过了 91.5% 那一栏。但这个虚拟人遇到一个真实的 App 报错时会怎么反应?跟一个真的 50 岁美国中西部主妇像不像?
论文没测。
还有两个数字也在转。一个是 4.135 分,这是人类专家给抽出来的人格打的分,满分 5 分。它评的是抽取得准不准,不是这个人格像不像一个活人。另一个是 Claude Opus 4.8 的打分,有 93.8% 跟人类专家差在 1 分以内,GPT-5.5 是 79.2%。有人把这条读成「大模型学会共情了」。它其实只说明这类打分工作可以交给模型做,能省钱。
三个数字都是实的。只是没有一个在回答那个真问题:这个虚拟人的行为,像不像一个真人。
我特意翻到了限制那一节。他们做的验证有三项:人口分布自不自洽、AI 遵不遵守人设、抽出来的人格人类打几分。没有一项,是拿模拟用户的行为跟真人在同一个任务上的行为去比。
附录 M 里有一句话。
在把结论用于真实人群或重大决策之前,仍然需要真人研究。
这是作者自己写的。93 个人的名字签在这篇论文上。
写到这儿像是在泼冷水。
不是。
这套东西的工程量是实打实的。四个环境:问卷、AI 聊天、网页、App。App 环境里 agent 能直接操作 Linux、macOS 和 iOS 的桌面,用虚拟鼠标键盘点,操作轨迹全记。1010 个任务,25 个领域,跑了 18189 次实验。这不是一个 demo。
我只是觉得,它现在能被信任的用法,跟大部分人想的不一样。它是用来撞 bug 的,不是用来找答案的。
举个具体的。你做了一个注册流程,自己测了十遍,都很顺。现在放 1000 个背景各异的模拟用户进去跑。有人母语不是英语,看不懂你写的那个缩写。有人用的是五年前的安卓机,你那个转场动画会卡。有人在地铁上单手操作,够不到右上角那个按钮。
这些路径你自己想不到,因为你不是这些人。
这个用法有个好处:它不要求人群比例是准的,只要求人群足够杂。83 亿这个数字放在这里反而是对的。你不需要它真的是人类。你只需要它多样到能撞出你没走过的那条路。
撞 bug 找的是「存不存在」。只要有一个人在这里卡住,这就是个真问题。他占人口的百分之几,不影响这个 bug 是不是 bug。
但换成另一类问题就不行了。
这个定价卖不卖得动。这个功能用户会不会喜欢。两个方案哪个转化率高。
这三个问题问的是「占多少」。「占多少」要求人群比例是准的。比例错了,百分比就是错的,结论可能整个反过来。
而这套人格库的比例,来自维基百科名人、Stack Overflow 开发者和亚马逊评论用户。不是来自你的用户。
最后说一件我更担心的事。
如果这类工具变成默认流程,产品会开始朝模拟用户收敛。不是因为谁想作弊。是因为模拟用户太便宜了。
真人调研一轮要两周,要花钱,要约时间,还经常约不到人。模拟用户跑一轮几个小时。两个方案摆在面前,一个有 91.5% 一致率背书,一个要等两周。选哪个不用想。
我自己做过一个给 AI agent 打分的训练场,里面的「客户」也是虚拟的。它们会提需求,会挑刺,会验收。所以这个便宜我很清楚有多诱人。
但模拟用户有个特点。它不会退款。它不会截图发小红书骂你。它不会在半夜十一点打客服电话,讲一个跟你产品逻辑完全无关的问题。而你就是从那通电话里才发现,你的产品逻辑一开始就假设错了。
真实用户教你的东西,很大一部分来自他们的不讲道理。而这套系统被设计出来要做的第一件事,就是过滤不讲道理。那张依赖关系图的工作,就是把不自洽的组合扔掉。
真人经常不自洽。
论文发出来六天,GitHub 上已经有人在 fork。我猜半年之内会有一批公司拿它当卖点,卖「AI 用户研究」。也会有一批产品经理,拿它跑出来的报告去评审会上做依据。
那份报告会很好看。它比真人调研整齐得多。
参考来源