你是否想过,我们所处的世界或许只是一段虚拟程序?
马斯克曾在Lex Fridman的访谈中被问及:假如人类某天实现了AGI,却只能向它提出一个问题,他会选择什么?
沉思十秒后,他答道:
“模拟之外是什么?”
这是马斯克对世界的根本疑问。早在2016年,他就声称,人类生活在真实世界的可能性或许不足十亿分之一。当然,这种近乎科幻的设想至今未获科学证实。
但引人注目的是,随着AI技术近期的推进,硅谷已有人开始扮演“创世者”,着手构建AI的“模拟世界”。这催生了一条新兴赛道——AI Simulation(AI模拟)。
近来,这一领域热度攀升。李飞飞与Andrej Karpathy共同投资的Simile,最新估值达20亿美元;由00后团队创立的AI模拟预测公司Aaru,估值也逼近10亿美元。哈佛大学与麻省理工学院联合发起、200多位研究者参与的MatrAIx项目,更是打造了83亿个AI虚拟人格,近乎将全人类映射至数字空间。

本文就来探讨一下正逐步升温的AI Simulation。
AI究竟能将一个人模拟到何种程度?当成千上万个Agent被置于同一虚拟世界,它们会自发形成类似人类社会的关联与规则吗?企业又为何愿意付费,让这些“数字分身”代为测试产品,甚至提前预判尚未发生的未来?
此外,当这些Agent开始拥有记忆、性格与关系,甚至催生出创造者未曾预料的行为时,我们究竟是在模拟一个世界,还是在创造一个全新的世界?
如今,许多领域都在谈论Simulation,但各领域所指的“模拟”并不一致。机器人与自动驾驶领域涉及物理仿真,世界模型研究聚焦于对物理世界的模拟,而我们此次要讨论的是一个维度更广、也更复杂的概念:模拟人类与社会,并借此理解乃至预测现实世界。
> 孟醒 > 五源资本合伙人 > 在世界模型或物理世界模型中,最小粒度理想状态下可能是世界中的某个分子或原子,模拟的是某些物体。但在智能体社会中,我们模拟的最小单位是一个个体的人。 > 我其实不关心这个人的手如何移动、往哪里跑,关心的是这个人作为一个整体,会采取何种行动,最终输出何种行为。若将其映射到大学学科,物理世界可能对应自然科学,而智能体社会则对应人文学科、社会学科、政治学与心理学。

关于模拟人类与社会,最早引发广泛热议的,实则是一篇20多年前的哲学论文。2003年,牛津大学哲学家Nick Bostrom在《我们是否生活在计算机模拟中?》中提出一种推演:若一个先进文明拥有足够强大的算力,并有意通过模拟重现文明演进历程,那么模拟世界中的意识数量可能远超真实世界。从概率角度看,人类便有可能身处模拟世界之中。这便是后来广为流传的Simulation Hypothesis(模拟假说)。
受限于技术条件,二十多年来,这一假说大多停留在哲学讨论与科幻作品中。直至近年,大语言模型取得突破。
2023年,斯坦福大学与谷歌联合发布了一项对AI Agent研究影响深远的实验——Generative Agents(生成式智能体)。研究团队搭建了一个像素风虚拟小镇Smallville,内有街道、房屋、咖啡馆,以及25个穿梭其中的虚拟居民。这些居民均由大语言模型驱动的AI Agent构成,各自拥有记忆、性格与行为逻辑。

这些Agent的活动并无预设“剧本”。研究者仅将它们放入小镇中观察,结果发现,它们不仅会自行生活、工作与建立关系,还能自主思考并规划行动。例如,一个Agent准备举办派对,消息传开后,其他Agent会依据自身安排重新规划时间,决定是否参加。“斯坦福小镇”让许多人首次直观地看到,Agent能够拥有持续的记忆、规划与社交能力,并在互动中自然涌现出某些群体行为。
> 高森泉 > WorldVac CEO > 这项研究的意义在于,让人们认识到语言模型是可靠的,它确实能复现人类社会的某些现象。更多人开始关注这一领域,也让大家开始相信这件事是可行的。

25个Agent只是起点。随着模型能力持续提升、推理成本不断下降,研究者开始有能力进行更大规模的模拟,并逐渐形成了几种不同的探索方向。
其中一条路线,是在模拟精度上尽可能与真实个体对齐。2024年,斯坦福团队将实验规模扩大至1052个Agent。这一次,每个Agent背后都对应一个真实的美国成年人。研究人员先对真人进行约两小时的深度访谈,了解其成长经历、家庭、工作、价值观与生活经验,再将这些信息交由大模型,生成相应的AI“数字分身”。
如此获得的Agent,不再只是一个符合“平均画像”的虚拟人物。实验中,这些Agent回答社会调查问卷的结果,与真人两周后给出的答案达到了85%的相似度。这意味着,AI在一定程度上能够复现真实个体的部分想法与选择。
> 孟醒 > 五源资本合伙人 > 访谈也有技巧,并非随意进行。它会采用最高效的方式去“榨取”你是谁,本质上就是在“蒸馏”你是谁,并且蒸馏得较为精细。 > 其好处在于,针对每个个体,个体的特异性都会影响整个仿真进入的场景。
另一种研究思路,则不再过分关注某个Agent是否与真人高度一致,而是将重点放在Agent之间的关系以及一个社会如何演化上。
前麻省理工学院教授Robert Yang团队发起的Project Sid,曾直接使用大语言模型生成1000多个Agent,并将它们放入《我的世界》中运行12天。结果,这些智能体逐渐形成了经济、文化、宗教与法律等结构,一些社会关系开始自行“生长”出来。

不久前,Emergence AI也进行过类似实验。他们分别基于Claude、GPT、Gemini、Grok以及混合模型建立了5个平行世界,每个世界中放入10个Agent,用以观察不同模型驱动的智能体社会长期运行后的结果。在这一设定下,不同世界最终走出了明显不同的轨迹:有的迅速陷入混乱,有的因协作不足逐渐崩溃,也有的形成了相对稳定的治理秩序。
> Satya Nitta > Emergence AI CEO > 如果仅看静态基准测试,就认为这些系统是安全的,很可能会出错。因为Agent会在非常复杂的环境中运行,无论是物理世界还是数字世界。它们会与其他Agent互动,也会受到环境噪声与变化的影响。 > 因此,我们正逐步将Emergence World发展成一个用于研究长周期自主性的基准测试。

还有一条研究路线,专门从“评估”入手。例如MatrAIx,试图为AI模拟建立一套评估基础设施。这项研究由哈佛大学、麻省理工学院等机构牵头,汇集了200多位来自学术界与产业界的研究者,其中还包括40多位来自OpenAI、Anthropic等前沿AI实验室的参与者。
MatrAIx构建了一个包含83亿个独特人格的数据集,每个人格由心理特征、生活习惯等1290个维度定义,再通过大模型将这些人格转化为可行动的Agent。这些Agent随后进入问卷调查、AI聊天、网页浏览和App等四种环境,完成超过1.8万次测试。研究团队通过400次受控实验发现,91.5%的情况下,Agent都能遵循预设的人格与行为特征。
> Xiaomin Li > MatrAIx联合创始人、微软高级研究科学家 > 我们进行基础设施评估、提升最低能力水平,是希望先通过用户群体的多样性,在产品真正问世之前,就能在各种情况、各种使用方式下对其进行评测。 > 它可能会触及许多边缘场景。这些边缘场景的分析非常有用,Agent可以告诉你哪一步错了、哪一步它不喜欢,以及它背后的推理为何会形成这样的偏好与选择。 > 因此,我们首先需要一套方法论,知道如何构建事实基准,然后再说如何提升。

当AI模拟在研究层面被证明具有一定可行性后,一个更现实的问题随之浮现:如果AI确实能在数字世界中复现人类行为、推演社会运行,它能够产生何种真实的商业价值?
从当前探索来看,AI模拟首先出现的一类商业模式,是直接将“模拟”本身作为一种产品。
其核心逻辑,是将现实世界中的人、消费者乃至社会关系,转化为可被反复调用的数字替身。例如,一家公司可按自身具体需求,快速生成一批拥有不同年龄、背景、偏好与行为特征的Agent,让它们提前体验产品,在虚拟环境中反复测试,再观察这些Agent如何选择、如何对话、何处流失,从而为产品设计与迭代提供参考。
这与传统市场调研的一大区别在于,企业想看到的不仅是一个“喜欢”或“不喜欢”的答案,而是Agent为何会形成这样的判断。
> Yuexing Hao > MatrAIx联合创始人、MIT EECS博士后 > 并非只是他们是否喜欢这个产品,或是否喜欢可口可乐涨价两块钱,而是看其推理过程。他在此过程中遇到了何种波折,或何种想法,导致他在预测过程中发生了转向。 > 我们不仅要看到个体如何做决策,也希望看到群体层面的结果。如果是百万级、数亿级,甚至83亿级的人格,他们最终会出现怎样的结果,我觉得这些都极具意义。
因此,这种思路本质上是将模拟本身作为一种产品评估与观察手段。Emergence AI告诉我们,他们进行Emergence World实验,一个重要目的也是为了测试自身提供的Agent产品,在进入复杂环境后是否依然安全。
> Satya Nitta > Emergence AI CEO > 我们会用Agent去做一些事情,比如帮助改善半导体良率。Emergence World这个实验非常重要,因为我们需要理解,我们构建的Agent真正运行起来以后,是否会采取安全的行动,能否持续遵守我们设置的安全护栏与基本规则。 > 更重要的是,它们能否给出真正值得信任,而非来自幻觉的输入、建议与洞察。

这种单体模拟的能力,也可进一步扩展至整个“社会”。例如,英国创业公司Artificial Societies,主打“社会关系”测试。他们让大量拥有不同人格的AI Agent彼此互动,形成一个可进行实验的虚拟社会。企业可将产品、品牌或营销策略放入其中,再观察不同Agent之间如何交流、影响与做出反应。
MatrAIx的下一步,也计划让这83亿个人格真正“动起来”。
> Xiaomin Li > MatrAIx联合创始人、微软高级研究科学家 > 我们会在新版本中加入动态人格属性,这些属性是可以变化的。还有一个假设是,若现实生活中发生一些重大事件,它也会对人格与行为产生影响。
而且,这些合成人格未来也不一定只能存在于数字世界。MatrAIx团队正尝试将人格放入机器人等现实载体中,让不同的思维模式与行为模式从虚拟环境进入现实世界。
> Xiaomin Li > MatrAIx联合创始人、微软高级研究科学家 > 我们会将人格加到机器人上,让它不仅存在于虚拟世界、存在于Matrix里,甚至能在现实生活中与我们互动。 > 这样,我们可以真正感受到不同人格背后代表的思维模式与行为模式是不同的。
由此看来,AI模拟未来或许不只是一种市场调研工具,也可能成为人机交互的一层基础能力。但现在许多人认为,仅停留在“模拟”还不够。在此基础上,更有趣也更具挑战的事情,是预测。
在商业中,“预测”往往代价高昂。企业是否应进入一个新市场?产品价格上涨10%后会怎样?若政府调整一项政策,会对整个社会产生何种影响?这些问题的答案,通常只有等事情真正发生后才能知晓。
AI模拟如今提供了一种新可能:先将这个尚未发生的未来,在虚拟世界中运行一遍,再将结果作为现实决策的参考。目前,在更侧重“预测”的AI模拟公司中,两家较有代表性的企业是Simile与Aaru。
Simile由“斯坦福小镇”项目的一批核心研究者Joon Sung Park、Michael Bernstein、Percy Liang等人创办,其思路是从“模拟一个人”开始进行预测。在2024年“数字人格”研究的基础上,Simile尝试通过深度访谈等方式,尽可能高精度地还原一个人的记忆、经历、反思与决策过程,再将这些AI Agent放入不同环境中持续行动。
这样一来,模拟回答的问题不再只是“这个人现在怎么看”,而是可进一步观察:当价格、政策等外部条件发生变化后,这个人会怎么做,是否会改变原先的选择。Simile想建立的,是一个“人类行为基础模型”,通过模拟人的行为过程,推演现实世界可能出现的结果。

由于这条路线追求尽可能“真实”,因此更适合消费者研究、产品测试、客户体验与投资者关系等需要深入理解特定人群的场景。Simile于今年2月正式亮相,目前估值已突破20亿美元。根据公司披露的信息,自上线以来,Simile已为财富100强企业运行了数千万次模拟。美国大型连锁药房CVS也已与Simile合作一年,通过真实用户数据构建了多达40万个数字分身,用于研究患者按时服药、测试消费者体验与辅助产品设计。
但高保真的另一面,是成本与规模化的代价。
> Yuexing Hao > MatrAIx联合创始人、MIT EECS博士后 > 在Simile这种情况下,若需要非常准确,可能会极难标准化。例如,可口可乐所需的用户画像,与TikTok所需的用户画像完全不同。 > 对公司而言,代价是针对每家公司、每种场景,都可能需要重新进行后训练或预训练。这样的代价是巨大的,且其可迁移能力目前未知。
以Aaru为代表的另一条路线,则直接通过“群体模拟”进行预测。它不追求将某个人的思想还原得特别深入,而是基于现实世界的人口、消费等数据,快速建立一个尽可能接近真实世界的模拟人群。

Aaru的数据大致分为三层。第一层是人口普查、就业、健康等公开数据,用于搭建基本人口结构;第二层是匿名消费记录、常去地点、关注媒体等授权数据,用于补充人群近期的真实行为;第三层则是客户提供的私有数据,例如企业自身的用户分层、购买历史与产品信息等,将模拟范围收窄至真正需要研究的人群。
在此基础上,Aaru会进一步构建一张关系网,不仅使年龄、收入等人口属性接近现实,也尽可能还原行为特征及它们之间的关系。接下来,系统会改变价格、产品或政策等某一个现实变量,再观察整个群体的行为如何变化,以此推演现实世界可能出现的结果。
> 孟醒 > 五源资本合伙人 > Aaru可能更关注速度,也更关注群体之间发生的关系。至于某个个体所受的深刻影响是什么,它可能并不那么关心。
Aaru的创始团队非常年轻。两位创始人Cameron Fink与Ned Koh成立公司时分别只有18岁与19岁,技术负责人John Kessler甚至只有15岁。最初,他们在朋友家的地下室里用美国大选验证这套系统。在回测2020年大选时,预测结果与实际结果仅差不到0.5%。
真正让Aaru受到关注的,是2025年纽约市长民主党初选。当时外界普遍看好前纽约州州长库莫,Aaru却通过大规模模拟预测了曼达尼最终胜出。由于规模大、速度快,这条路线也适合进行大规模市场调研。
目前,Aaru的客户已包括麦当劳、安永、拜耳、A24等公司。安永曾让Aaru复现一项复杂的全球调研,Aaru一天完成的结果与原调查高度吻合;气泡水品牌Spindrift原本花费两个月、招募500名消费者完成的一项调研,Aaru的Agent用一周就得出了几乎相同的结论。这些真实案例也使Aaru的估值迅速上升,目前已接近10亿美元。
最近,一些AI领域的重要研究者也开始押注“预测”这门生意。卡