把“凯撒密码”改写成“航海旗语”:每面旗对应一个字母,玩家看到七面旗,对照旗语表读出七个字母,再往后错三位。谜面从罗马变成了海港,铜版画风格的旗帜也很好看,可玩家解它的动作没有变化:查表,位移,拼词。这就是常见的“换皮”。语言模型很擅长这件事,因为换皮只需要在语义空间里做替换,不需要理解谜题为什么成立。

真正的谜题设计,要回答另一个问题:玩家在这个谜题里,需要发现什么,推理什么,怎样知道自己对了。

谜题的骨架:信息、步骤、反馈

抛开故事,一个谜题至少由三部分构成。信息结构,是玩家手里有哪些线索、它们分散在哪里、彼此有什么冗余;推理步骤,是从线索到答案要跨越几步、每步需要什么样的思考;验证反馈,是玩家怎样知道自己的答案对不对,门开了,还是听到一声轻响。换皮只改变表面的名词,这三样都原封不动。

所以判断AI有没有“设计”谜题,最直接的办法是看这三样有没有变化:换了一套信息结构,换了一条推理路径,或者换了一种反馈方式,才算得上新谜题。

散落的齿轮、钥匙、符号盘等谜题零件经虚线连接拼成一台新机关,机关右侧的验证器打出醒目的对勾。
这张图说明:生成式AI设计谜题要把零件重新组合成新机制,并由验证器确认它真的可解。

把谜题拆成机制原子

PA真人游戏世界智能研究组把常见的谜题拆成几种可以组合的机制原子。它们像积木,一块积木并不有趣,但组合方式可以是新的。

机制原子 玩家做什么 典型风险
密码 依据规则转换符号规则太单一,容易被暴力尝试
对应 把两组事物一一配对配对不唯一
排序 依据线索排列先后 线索不足以确定顺序
遮挡 移开或叠加遮蔽物读出信息 物理上不可实现
时序按时间窗口执行操作 对新手过于苛刻

看一个组合的例子。“对应”加“遮挡”:药柜的十二个抽屉贴着拉丁文标签,标签与药名的对照表被撕成两半,一半在处方单,一半印在一块半透明的滤光片上。玩家必须把滤光片盖在药柜标签上,才能读出真正的抽屉编号,再用它去对应处方单上的剂量顺序。这里既有空间操作,又有配对推理,与单纯的“查表位移”已经是不同的信息结构了。

在约束下组合,而不是自由发挥

让大模型直接“想一个谜题”,结果往往是听起来有趣、实际做不成的东西。更可控的做法,是让它在约束下组合:给定房间主题、可用道具清单、目标步数、机制原子的白名单,输出一份结构化的谜题规格,而不是一段故事。

{
  "atoms": ["mapping", "occlusion"],
  "steps": 3,
  "props": ["prescription", "filter_sheet", "drawer_wall"],
  "answer_space": 12,
  "feedback": "drawer_opens",
  "constraint": {"unique_solution": true, "max_hint_leak": 0}
}

规格先于文字。有了规格,故事、标签、纸张质感才可以再由AI去写,而这一步才是它最擅长的部分。

选择机制原子约束下组合求解器验证难度估计设计师筛选
本文讨论的谜题生成流程:先组合机制,再用程序证明它能解、且只有一个解。

生成之后的四道检查

谜题生成本身并不可怕,可怕的是生成后不检查。PA真人的设计思路里,每个候选谜题都要经过以下几道关口。

  1. 可解性验证:用求解程序按规格走一遍,确认存在从线索到答案的路径。
  2. 唯一解验证:枚举答案空间,答案数量必须恰好为一(示例中的十二个抽屉,需要确认只有一种排列满足全部约束)。
  3. 难度估计:统计求解需要的步数、需要同时记住的信息量、可能的干扰项数量,用来判断这是新手题还是老手题(示例参数,非行业标准)。
  4. 依赖图检查:把这个谜题放进整个房间的谜题依赖图,检查它是不是被别的谜题锁住,或者它自己是不是锁住了别人,具体做法与 关键线索的可达性验证 是同一类思路。

四道检查里,唯一解最容易被低估。AI生成的对应类谜题,常常出现两组答案都满足全部条件,玩家给出了一个合理但“错误”的答案,被系统判失败,那种被冤枉的感觉,比谜题太难更伤体验。

三种典型失败

多解。排序谜题里给了三条先后线索,实际上还有两种排列都满足,玩家找到的答案和设计答案不一致。检测方法就是唯一解枚举。无解。遮挡谜题里,两张透明片叠加后要读出的数字,在真实印刷里会被线条遮住一半,只有程序里的理想图形才可读。这一类需要物理约束或设计师的目测。提示泄底。为了让谜题“可解”,AI在旁白里多写了半句,恰好把关键关系直接说了出来。这与 提示阶梯 里强调的“提示不能替玩家完成推理”是同一个问题,只是发生在谜题本身的文字里。

设计师还剩下什么

如果这些检查都由程序完成,人类设计师似乎无事可做,其实恰恰相反。程序能证明“能解”和“唯一”,证明不了“好玩”。一个谜题是否有那种恍然大悟的瞬间,物件是否符合房间的时代与气味,节奏是否和前一个谜题形成对比,这些判断依然来自人。AI适合生成一百个候选,设计师从中挑出三个,再手工打磨其中一个;这比让AI“写一个完美谜题”靠谱得多。

还有一件事没有很好的答案:怎样自动衡量“新意”。现在能做的,是比较两个谜题的规格差异(原子是否相同、步数是否相同、反馈是否相同),但规格不同并不保证体验不同。目前只能靠试玩数据反过来验证。玩家在试玩中卡在哪一步,也可以借助 玩家状态估计 的方式收集。更多密室设计思路,见 PA真人AI密室游戏 栏目。