你可以到本博客的关于界面中试玩最终优化过的成果。

本次测试使用许愿式,即一句话生成项目,不采用过于复杂的提示词。内容是生成一个网页版后室游戏。提示词如下:

写一个网页版Backrooms(后室)游戏,要求功能完美全面,越还原越好,任何不确定的可以去联网找资料。使用bun。要求最后一关是 level!,即追逐关卡。
注意要支持选择中英双语

主要是对比在使用 chatgpt 的情况下,opencode 工作流和官方 codex 谁的体验和效果更好。

前置细节介绍

opencode 使用 omo-slim 插件和 magic-context 插件,agent分配如下:

Agent 名称模型名称思考强度
orchestratorgpt-5.6-solmax
oraclegpt-5.6-solmax
momusgpt-5.6-solmax
librariangpt-5.6-solmedium
explorergpt-5.6-solmedium
designergpt-5.6-solmax
fixergpt-5.6-solmax

NOTE

之前我用全 xhigh 测试了一下,结果成品质量太差了,于是都改成了 max。

codex 使用 max 档位,由于结合社区反应和不相信 codex 的子代理,所以没有使用 ultra 模式。

codex 使用 /goal 模式,opencode 在描述完提示词后自动进入了 omo-slim 的 deepwork 模式。

两个 agent 都使用了 ui-ux-pro-max-skillmake-interfaces-feel-better skill。


实现过程

两个 agent 在过程中都进行了自动游戏测试。值得一提的是,codex 在初版有鼠标跳帧的 bug,修了一轮之后才好。

具体效果请查看 该视频

codex 使用的 token 数如下,

opencode 使用的 token略多。

顺带一提,max 的推理强度实在是慢的夸张。

插曲

我测试了 grok-4.5,使用同样的提示词。

结果这个沟槽的直接拿之前其他 agent 写出的成果随便改了改就作弊交差了。

令人忍俊不禁。