对一个雄心勃勃的设计方案的批判,以及一份更诚实的蓝图:如何模拟世界和其中生成的意义
最初的那份游戏设计方案在智识上是慷慨的,但它的错误却富有启发性。它构想了一个“最大程度地像真实世界”的游戏,目的是照亮生命的意义,并试图以斯多葛主义、Ikigai(生命价值)、社会-经济代谢、GOAP和生成式智能体作为承重结构。这种抱负令人钦佩;但承重之处尚未真正承重。本文试图穿上鞋子走同一条路——保留原方案中真实的部分,点明哪些只是愿望,并提出一个真正可以建造、游玩并且还能撑得过自身野心的版本。
最初的方案最有用的地方在于它的诊断价值。它的弱点其实就是整个领域反复出现的弱点,只不过被说得很有信心而已。尤其有四种替代谬误值得点名,因为每一份“雄心勃勃的模拟游戏”提案——从《孢子》到《星际公民》,再到那些未能出货的Kickstarter项目——都会犯同样的错误。
方案在“写实”(看起来、听起来像世界)和“真实”(在压力下像世界一样运作)之间滑来滑去。这两者几乎是无关的属性。《矮人要塞》拥有已发行游戏中最具因果真实性的世界,但它只有ASCII字符画。而首发时的《赛博朋克2077》有着照片级的画面,行为却像一座僵硬的布景。一部关于意义的模拟器需要的是因果深度,而不是多边形数量。混淆二者就是用最快的方式花掉八千万美元,造出一个灯光漂亮的主题公园。
将意义建模为Ikigai四个轴向上的权衡,这种做法听起来很严谨,但从机制上讲是范畴错误。一旦幸福论(eudaimonia)成了玩家可以优化的数值,它就不再是幸福论,而变成了另一条经验值条——受制于古德哈特定律:当一个指标成为目标,它就不再是一个好的指标。《模拟人生》这么做了二十五年,产出了一个极好的娃娃屋,而不是道德导师。我们真正称之为“有意义的人生”的东西,其实恰恰是那些我们未曾刻意优化的选择留下的残余。
方案引用LLM驱动的NPC,好像Park等人的“生成式智能体”论文已经终结了所有讨论。远非如此。Smallville展示了25个GPT-3.5级别的智能体可以貌似可信地模拟一个小镇两天时间,但作者礼貌地没有列出具体花费,而独立估算认为是每次模拟日数千美元。将这一规模扩展到拥有上千居民、连续运行、且要在消费级机器上跑——这不是待办清单上的一项,而是未来十年的整个研究纲领。任何严肃的计划都必须明确:哪些对话由LLM驱动(可能只有少数有名有姓的角色,按需触发),哪些不是(其余所有部分)。
原方案中的五个阶段——规划、预制作、制作、测试、发布——描述游戏开发的方式就像“食物”食谱描述厨房一样。不能说错,但毫无用处。它缺少的是:预算、团队构成、AAA路径与独立作者路径的区别、这一规模项目的失败率(非常高),以及在项目拖垮整个工作室之前将其终止的关口标准。本文将把这些问题当作真正的硬骨头来处理。
原方案写得好像“一个像真实世界的游戏”还是未开垦的处女地。其实不然。六十年的游戏设计已经描绘了其中的大部分版图,任何严肃的项目都应当从了解已有成果开始——包括已经证明可行的,以及已经证明不可行的。
| 标题 | 它示范了什么 | 它做不到什么 |
|---|---|---|
| 《矮人要塞》(2006-) | 跨越数百年的历史模拟;生理、社会、地质系统深度耦合,涌现出个人化的叙事 | 上手性;可读性;把自身的深度以视觉方式呈现出来 |
| 《十字军之王III》(2020) | 角色心理、王朝政治、压力驱动的衰败,作为道德戏剧的发生器,且规模宏大 | 经济深度;生态耦合;无名者的生活 |
| 《星战前夜》(EVE Online)(2003-) | 真正的玩家驱动型经济——以至于CCP公司专门聘请了一位真正的经济学家(Eyjólfur Guðmundsson)每季度发布报告 | 上手性;电子表格之外的意义 |
| 《环世界》(2018) | “故事叙述者”导演型AI架构,从系统混沌中产生叙事弧线——明确设计用于涌现故事,而非最优结果 | 殖民地之外的规模 |
| 《星际拓荒》(2019) | 知识即进展。玩家在整个循环中唯一获得的就是理解。死亡即是引擎 | 重复可玩性;规模 |
| 《极乐迪斯科》(2019) | 技能作为内在的竞争声音;意识形态即玩法;失败即内容 | 过程生成;主角头脑之外的世界 |
| 《瘟疫2》(Pathologic 2)(2019) | 充满敌意的时间压力与不可撤回的后果,作为道德工具。游戏惩罚“存档” | 大众吸引力 |
| 《生态》(Eco)(2018-) | 多人环境治理,拥有真正模拟的生态系统和由玩家立法的法律 | 单人游戏;叙事连贯性 |
| 《剑士》(Kenshi)(2018) | 派系AI作为独立智能体,追求自身目标而无视玩家;一个不以玩家为中心的世界 | 情感共鸣 |
| 《这是我的战争》(2014) | 稀缺中的关怀作为核心机制。道德伤害被建模为一种状态 | 长期的文明尺度 |
| 《模拟人生》(2000-) | 马斯洛式的稳态需求作为社会引擎;日常琐事成为值得关注的主题 | 有分量的死亡;不会重置的意义 |
由此得出两个观察。首先,原方案中提出的每一个组件——耦合代谢、基于智能体的NPC、幸福论机制、分支叙事——都已经在某个游戏中实现过。但没有任何一个游戏把它们组合在一起。尚未解决的难题不是发明,而是整合:如何将深度生态、深度经济、深度心理与深度叙事塞进同一个产品,而又不让整合成本把四个部分全部吃垮?
其次,那些最接近“探索生命意义”的游戏——《星际拓荒》《极乐迪斯科》《瘟疫2》《这是我的战争》——并非模拟最深的那一批。它们是作者性最深的那一批。在原方案指向程序化生成作为通往存在重量之路以前,这个事实值得它认真思量。
如果说“现实主义”是承重词,那它就必须比原方案更具体。有四种不同的属性往往被混在同一面旗帜下,它们各自带来的成本和收益也各不相同。
| 种类 | 含义 | 成本与收益 |
|---|---|---|
| 感官现实主义 | 世界看起来、听起来、动起来都像现实世界 | 巨大的美术预算;带来沉浸感但非意义。过了某个阈值后收益递减 |
| 因果现实主义 | 系统的行为方式如同现实世界受扰动时的表现。因果无需人工衔接即可传递 | 模拟工程学;产出“活的世界”的感觉。最难交付的特性 |
| 现象学现实主义 | 游玩过程中的每个时刻,感觉就像在活一个生命。时间压力、无知、具身、不可逆 | 设计层面的纪律,而非金钱;带来存在的重量。往往对“好玩”有敌意 |
| 道德现实主义 | 选择带来的后果不会干净解决,不会奖励玩家,且无法通过读档抹除 | 写作和设计的勇气;产出意义。最常被快速存档背叛 |
原方案四个都追,但只为一个(最廉价的那个,感官的)做了预算。一个站得住脚的方案应该挑两个,然后做深。对于一个核心问题是“活一辈子意味着什么”的游戏来说,正确的两个选项是现象学和道德——底下只需有足够的因果现实主义,让道德重量有一个可以着陆的世界。感官现实主义应当排在最后,而不是第一。
如果我们保留原方案对系统深度的承诺,我们就必须把系统具体化到原方案未及的程度。下面是四个承重子系统,每个都附有诚实的计算与设计预算。
基于智能体的模拟是合适的“世界基底”。成熟的开源框架——Python的Mesa、NetLogo、MASON、Repast——已经证明,数百万个简单智能体可以在普通硬件上运行。但在实时、游戏内、已发布的产品中,更现实的预算是任何时刻同时运行一万到两万个智能体,其余通过人口流量进行抽象。诀窍不是跑更多智能体,而是正确地隐藏当前玩家看不到的那部分。
目标导向行动规划(GOAP)适用于实时的行为——2005年的《F.E.A.R.》就用了它——但在大规模下很脆弱,因为规划成本随着行动集大小快速增长。效用型AI(《模拟人生》和许多策略游戏使用)成本更低、降级更平滑。一个现实的方案是以效用AI为默认,将GOAP保留给有名有姓的角色和战斗场景。
Park等人(斯坦福,2023)的《生成式智能体》论文是LLM驱动的NPC的恰当参考文献;但同时它也展示了成本有多高。诚实的预算是:
| 模式 | 可行性 | 原因 |
|---|---|---|
| 所有NPC始终完全由LLM驱动 | 不可行 | 成本和延迟。即使使用2026年最便宜的模型,一个200名智能体、每“分钟”都思考的小镇,每小时也要花费数百美元 |
| 有名有姓的NPC按需由LLM驱动,带记忆层 | 可行 | 这正是Smallville实际演示的情况。如果克制使用,是可以交付的 |
| 在设计时使用LLM生成预置NPC对话、事件反应 | 已是行业标准 | 2024-2025年的一些游戏已经这么做;LLM从不在运行时执行 |
| 使用LLM作为模棱两可社会性结果的裁判 | 实验阶段 | 有趣的前沿。用于“这个角色在这种情况下可能会做什么”,并积极缓存结果 |
这里最好的存在证明仍然是《EVE Online》。CCP决定发布季度经济报告,把一款MMO变成了经济学家引用的对象。一个现实的计划不需要复刻EVE;只需要在两个成熟的传统之间做出选择:
对于一款关于意义的游戏,基于智能体的路径是正确的——不是因为更精确(它既更精确也更不精确),而是因为玩家必须能够亲眼目睹市场崩盘,而不是被告知崩盘发生了。
原方案用氮循环作为说明。实际版:完全基于过程的营养模型(如SWAT水文模型或Madingley全地球生态模型)远超实时游戏的能力范围。但一个参数化的版本——捕捉营养流的拓扑结构、因果与退化之间的延迟、以及某些失效的不可逆性——是可以交付的,并产生设计价值(长时程后果),而不至于带来计算上的毁灭。
模拟设计中最重要的一个比例是感知到的系统深度与计算出的系统深度之比。《矮人要塞》的比例大致为1:1——你看到的每一件事物都在被计算。《巫师3》的比例接近1:0.1——几乎一切都是布景。对于一个雄心勃勃的模拟游戏,理想比例大约为1:0.3:足够多的真实计算让世界能超出设计师的预期,同时足够多的布景让它不至于破产。
这是原方案最需要修改的层面。斯多葛主义和Ikigai都是真实存在的哲学传统,但把它们变成数值滑杆是种虐待。论点并非它们不能启发游戏设计,而是它们不能以变量的形式来启发游戏设计。
一份对被认为改变了人生的游戏的审查——《星际拓荒》《瘟疫2》《极乐迪斯科》《尼尔:机械纪元》《特种部队:一线生机》《这是我的战争》《旺达与巨像》《传说之下》《活体脑细胞》——揭示了一组反复出现的语法。这些游戏没有一个量化“意义”。但它们都使用了以下元素的某些组合:
原方案提出,平衡Ikigai的四个轴线会产生“稳态——一种内在幸福感的稳定状态”。这就是陷阱。一旦玩家能看到那四条条,游戏就变成了关于那四条条的事情。“寻找你所爱”的活动不再是寻找爱,而是变成填满条的活动。这并非假设——而是每一次设计师尝试这样做时可预测地发生的结果。那些将心理健康游戏化的App表现出了同样的失败模式。
校正方法是结构性的。与意义相关的状态应该不在UI中显示测量值。游戏应该知道自己关于玩家生活所知道的那些信息,并且通过世界的回应来体现它们——就像《十字军之王》中的流言系统反映了玩家的选择,却从未显示一个可以被优化的“声望”数字。写成、不透明、有后果。而不是透明、可优化、游戏化。
原方案中的斯多葛公式——V = f(A, E),玩家的德行是内在同意与外在事件的某种函数——把斯多葛主义当作一个控制器方案。它真正的主张更加艰难:对于命运,唯一稳定的回应是培育一种不依赖命运的性格。能够捕捉这一点的游戏机制,不是在危机时刻按下一个按钮,而是主角在五十小时的游戏中每一次微小的、未曾被监视的行动中所积累的性格——并在最后,通过世界对他们的评价而显影出来。
这是可以实现的。但也很昂贵:它需要真正在做工作的记忆模型、一个对玩家不透明的评估函数,以及一个拥有勇气去呈现最终判决而不提供“重来”的结局。
并不存在一个单一的“游戏之镜”项目。实际上有两个,它们是不同的产品,面向不同的受众,有着不同的破产方式。点名这两种道路,是原方案所欠下的战略性诚实的第一笔债。
| 路径A —— 准AAA | 路径B —— 作者独立 | |
|---|---|---|
| 预算 | 3500万–8000万美元 | 100–400万美元 |
| 团队规模 | 80–150人(峰值) | 6–15人 |
| 时间线 | 5–7年 | 4–6年 |
| 引擎 | 虚幻5或自研;3D高保真 | Godot、Unity或自研2D;刻意克制的美术风格 |
| 参考作品 | RDR2(规模,而非主题);CK3(深度);极乐迪斯科(写作) | 矮人要塞(模拟范围);星际拓荒(意义范围);Qud洞穴(奇异范围) |
| 资金模式 | 发行商或大规模自筹。要求类型可辨识 | 抢先体验、赞助或资助。要求在第二年做出可交付的垂直切片 |
| 风险特征 | 失败则灾难性;可能会拖垮整个工作室 | 失败后仍可存活;创始人自己承担损失 |
| 什么会杀死它 | 范围蔓延、发行商恐慌、第四年的人员流失 | 创始人 burnout、“第五年之墙”、社区疲劳 |
| 历史先例 | 《孢子》(过度承诺、交付不足);《星际公民》(集资却不发布);《死亡搁浅》(罕见成功) | 《矮人要塞》(靠信念撑了二十年);《环世界》(设计纪律);《Qud洞穴》(小团队,十五年) |
中间道路 —— 800万-2000万美元,30-50人,三年 —— 这是大多数工作室实际尝试的道路,也是统计意义上最终发布半成品或者干脆没发布的路。经济账是无情的:这个预算规模大到发行商会要求市场验证过的机制,小到团队无法同时交付那种模拟深度和那种制作打磨的程度。一个严肃的计划必须选一边。
原方案的五个阶段需要有牙齿。一个可防御的计划会在每个关口附上一个具体的生存标准 —— 一个数字或一个演示,如果没有达成,就终止项目,而不是继续投钱。
| 关口 | 生存标准 |
|---|---|
| 愿景阶段结束(第3个月) | 一段话的设计核心,工作室任意十个人都能够给出相同的转述 |
| 预制作结束(第9个月) | 一个可玩的15分钟垂直切片,让一个非团队成员无需提示就能体验到中央的存在性节拍 |
| 制作中期(第24个月) | 一个可玩六小时的游戏版本,展示无脚本干预的涌现叙事。如果到这时AI还不能产生惊喜,那它永远都不能了 |
| 制作后期(第42个月) | “墓园测试”:外部试玩玩家在几天后,能够自发地向他们的朋友描述一个角色的死亡,而不被追问 |
| 发布前夕(第60个月) | 在目标中档机器的极端情况智能体模拟下,稳定30+fps。没有商量余地 |
每一个雄心勃勃的模拟游戏项目都应该有能力在六个月内产出一个原型,用来回答——通过演示——核心设计猜想是否成立。对于《游戏之镜》,正确的猜想是狭小且具体的。
一个单一主角,在一个大约四十名居民的小镇上,经过一个游戏年,经历一系列微小的、大多无人见证的道德选择,其累积的重量能够在游戏最后的几分钟里让玩家感受到一幅“我已经成为什么样的人”的肖像——而整个过程中没有任何UI量化过那个“成为”。
原型不是完整的游戏。它只回答一个问题:这个核心手法奏效吗?如果六个月后,六位外部玩家被问到“描述一下你的体验”,他们的描述都汇聚到同一个存在性的节拍上——项目还活着。如果他们的描述出现分歧,那么猜想就是错误的,正确的做法是杀了这个项目,写另外一个。这就是纪律的样貌。
原方案中最雄心勃勃的声称是,这个游戏可以作为一个研究工具——玩家可以在其中运行政策实验,而结果能告诉我们一些关于真实世界的真实东西。最后,需要对这一点给出一个仔细的回答。
可以,但不会——不会以原方案暗示的方式。游戏的模拟不是对世界的建模;它是对其设计者关于世界的理论的建模,然后在规模上执行。当人们使用《模拟城市》来探索城市学时,他们学到的不是关于城市的知识,而是Will Wright在80年代中期对城市经济学的理解,再经过16位机器的折射。这仍然有价值。但不是科学。
诚实的框架比电子游戏古老:模拟器是一个寓言。它讲述一个关于制作人认为世界如何运作的故事,并且玩家可以通过游玩来拷问这个故事。拷问是真实的;得到的答案是关于寓言的。称之为研究工具是过誉。称之为无用则是贬低。它是一种进行道德和观念演练的工具——而这正是艺术一直以来的功能,也是任何电子表格从未有过的东西。
这就是原方案愿景的最强版本。游戏不是一面镜子;它是一个透镜,由具体的双手打磨,它所聚焦的是其制作者认为值得追问的、关于生命意义的某个具体问题。游戏变得越真——在§ III中区分的那个“真”的四种意义上——这个问题在玩家亲身经历时所承载的重量就越大。目标不是模拟世界。目标是做出一段玩家无法置之不理的论证。
这是值得建造的东西。而且,最终,这类东西需要六年的时间、八十人或八个人、一种愿意发布不讨喜结局的意愿,以及对所有中间道路的拒绝。在它的第一版讲述中,《游戏之镜》还不知道这些。但在第二版中,它或许会知道。