63 谈地狱级艰巨实测,GPT-5.6 把其他 AI 甩开了一截


断事如神,GPT-5.6 发布的同期,把 Codex 也「干掉了」,拔赵帜立汉帜的是一个包含 ChatGPT Work 和 Codex 的 全新 ChatGPT 驾驭。

然则你仍然不错选拔保留 Codex 阿谁云朵图标
选拔 Work 如故 Codex 刻下在界面的呈现上,莫得太大的区别。
独一相比明显的是,当咱们切换到 Codex 场景,ChatGPT 的回答会加上「代码各异」,鼠标悬浮在「已剪辑」文档上,就会泄漏拓荒者常见的 Diff 界面,绿色代表新增,红色代表删除。

左边为 Codex 场景,右边为 Work 场景
将来 OpenAI 偶然会对其阵势类别进行区别, 刻下切换场景,阵势都是分享的,所能使用的模子和 Skill 也都是通用的 。
咱们的 Pro 账号刻下不错选拔包括 GPT 5.6 在内的全部型号模子,推理强度从轻度到极高多个等第。

咱们在详备先容 GPT-5.6 的著述里提到了对于模子的更多信息,以及一些酬酢媒体上使用 GPT-5.6 来作念「我的天下」等 3D 游戏的案例。
刻下的大模子,一句话让他们写个网页,如故很难测出 AI 究竟有多强了。
大模子竞技场的 AI 身手慎重东谈主 Peter Gostev,在前几天公开了 63 条险些是有益为难模子的 3D 教唆词;从大型 3D 天下,到多样可游玩的 3D 场景、名画天下,以及顶点视角、当然奇不雅,和元素与天地终端地方等。

3D 天下的第一题就条目它用 Three.js 作念出齐全曼哈顿:开场必须看到整座岛,向下缩放时还要无缝进入街区,看到车流、渡轮、屋顶水塔和公园小路。
后头的题越来越有真谛。AI 要坐进烟花弹,从放射筒冲上天际,在爆炸的一刻停在一万条金色人烟的中心;也要把梵高的《星月夜》作念成能飞进去的油画天地,让每一齐笔触都保留色调厚度,还会沿着画里的漩涡流动。
尼亚加拉瀑布要同期出现马蹄瀑布和好意思国瀑布,水雾、彩虹与游船都得动。以及要让模子在海面上及时长出一座火山岛,岩浆、波澜、蒸汽、火山灰、闪电、盘考船和直升机从第一秒起共同运转。

由 Fable 5 制作的穿越张家界石林
以致还有穿越张家界石林、下雪的故宫、流浪地球的天外电梯等题目,AI 需要用代码来结束一个看起来很酷炫,本色操作起来也能用的 3D 网页。
就连 Karpathy 都在驳倒区留言,默示这些教唆词太有真谛了,以及模子到底是若何结束这些 3D 天下的。

LLM 是若何仅凭收罗就能掌抓通盘这些信息,并能将这些剖析回荡为 xyz 坐标、网格、变换、动画、殊效、交互和小故事的呢?想想再加多一个、两个、三个模子层级,它们又能创造出若何的精彩,果真令东谈主咋舌。
咱们也拿这套教唆词去测试了一下最新的 GPT-5.6,由于 5.6 Sol 的极高模式会使用多数的子智能体,凭据官方博客先容,Ultra 模式下默许会派出 4 个子智能体并行责任,最多不错有 16 个子智能体同期完成一个任务。
这也导致了运行时期的加多,相通的教唆词,咱们在 DeepSeek 的网页上,十分钟不到,它就能给咱们最终的寄托。
然则在 Codex 里,光是起原的方向制定,就需要咱们一直酬报「Yes」来先证据这份方向。
比及本色的责任,多个子智能体搬动,从 Task 1 到 Task 2,每个 Task 又分了 Scene、Control、Shell 等不同的责任,任务时期直线飙升。
还有经常时就要进行的「 咱们的系统正在进一步审查此情况,然后再酬报 」。

于是,相通的张家界石林,欧美日韩国产一区二区三区四区中文字幕在线咱们使用 5.6 Sol 的最高级强度,Codex 花了足足 2h41m35s 才完成,其中莫得任何的「恭候批准」时期,皆备是 Codex 我方在科罚。
GPT-5.6 Sol Ultra 生成
成果如实算得上最好,最像 Fable 5 的一个。
抛开我电脑本人卡顿的原因,通盘 3D 石林结束得十分专科。鸟群会在山谷飞过,山背对太阳时会有明显的暗影,以及山顶的树、玻璃栈桥,和索谈等元素都有相比多的细节。
咱们也用了其他模子进行测试,举例在 Codex 内使用的 GPT-5.5、DeepSeek V4 Pro、Gemini 3.5 Thinking、GLM-5.2、以及相通是最近刚发布的 Hy3。

GPT-5.5 生成,使用 Codex

Gemini 3.5 Thinking 生成,使用 Gemini 官网

DeepSeek V4 Pro 生成,使用 DeepSeek 官网

GLM-5.2 生成,使用 Zcode

Hy3 生成,使用 WorkBuddy
能看到差距如故相比明显的,对比 GPT-5.6,GPT-5.5 明显少了好多细节,即便把渲染进程挽救到「高」,石柱和树以及飞鸟等信息,都是相比苟简的建模。
Gemini 3.5、DeepSeek V4 Pro 和 Hy3 似乎都莫得准确把这个石林的成果作念出来,GLM-5.2 在这轮寄托的就愈加详尽了,仅仅结束了几种不同视角的切换,然则张家界石林是皆备看不出来。
这是齐全的教唆词,若是感趣味趣味还不错拿去测试一下其他模子的成果。
创建一个宏伟的 Three.js 张家界石林天下:数百根高得不可想议的砂岩石柱,顶部掩盖着松树,从流动的雾河中腾飞,不雅者如故跻身空中。径直从两根浩大的石柱之间的飘舞情状驱动,奶茶视频黄在线观看底下的雾气被分开,阳光斜射过岩壁 —— 不要标题界面、菜单、加载情状或贴地驱动。
若是使用 Three.js,请在模块剧本之前添加一个 import map,将「three」和「three/addons/」映射到归并个固定版块,况兼只通过这些称呼导入。通盘地形、岩石、植被、雾气和光照都必须要道化生成;不要使用外部图片资源或模子。
单一核热枕念:探索生长了动荡山脉灵感的天下,以最柔顺的飘舞神气穿行其中。
石林天下
- 设立具有真确地质特征的石柱:带状砂岩层理、陡峻岩面、承载污蔑古松的岩台、阴雨侧面的藤蔓和蕨类植物、被色泽照亮时呈现的白色岩石裂痕。改造高度和群落散播,让峡谷景不雅变成当然的通谈和露天戏院。
- 雾气是一层有生命的存在,而不是一团混浊的雾:潸潸河流在石柱之间流动,在旯旮扯破,在盆地中积蓄,同期保持上方空气澄澈、被阳光照亮。石柱应跟着雾气搬动而乍明乍灭。
- 东谈主类萍踪要小而远处:勾通两座山顶的玻璃栈谈、沿知晓滑行的缆车、刻在岩壁上的鬈曲石阶、用于比例感的微型徒步者。
石柱间的生命
- 猕猴在岩台上攀爬,鹤穿越虚空,雨燕围绕山顶盘旋,一条瀑布从裂隙中穿过,流入下方雾海,松枝随风舞动。
光与空气
- 黎明曦线,东侧岩面呈现款色,暗影峡谷中带有冷蓝色调,阳光映照处的雾气发光;实足的绿色;全体亮堂、通透。
滑翔体验
- 独一的交互神气是苟简可靠的滑翔:保持恒定且柔软的飘舞速率,鼠标法度航向和俯仰,并斥逐在柔软规模内,自动侧倾,不会失速,不会有碰撞刑事包袱 —— 围聚岩壁时,镜头会当然逐步遁入。飘舞嗅觉应像鹤一样,而不是战役机。
- 重置
咱们还用其他教唆词测试了一下 GPT-5.6,63 个案例的教唆词都不错在 GitHub 上找到。

险阻滑动搜检更多内容
阵势地址:https://github.com/petergpt/3d-prompt-collection
咱们也测试了 Karpathy 认为最有真谛的熊拿获鲑鱼画面。此次咱们径直在 ChatGPT 网页版内以泛泛对话的体式发给它教唆词,依旧是使用 GPT-5.6 Sol,智能模式为 Pro。

诚然莫得 Codex 严谨和详备的阵势工程,然则 Pro 的想考强度,如故让 ChatGPT 花了 40 分钟才生成了通盘 3D 页面。
临了的收尾对比,GPT-5.6 Sol 和 Fable 5 不错说是在归并个水准。
GPT-5.6 Sol 生成,使用 ChatGPT 网页

Fable 5 生成
而使用其他模子,像是 DeepSeek V4 Pro,能明显看到生成页面有好多 Bug,一只奇怪的熊,鲑鱼也变成了苟简的红色方块,彩虹仅仅苟简的六根线条等。

DeepSeek V4 Pro 生成,使用 DeepSeek 网页
Gemini 3.5 Thinking,这个五月份的模子,中间这个四四方方的像素物体,尽然便是 Gemini 样子的 3D 熊。
诚然该有的操控都有,导航栏这些按钮都作念到位了,然则若是提前没了解教唆词信息,单看这个页面,皆备不知谈本意是想样子什么。

Gemini 3.5 Thinking 生成
咱们还测试了天外电梯阵势,此次是在 Codex 内使用 GPT-5.6 Sol,想考强度选拔选拔了倒数第二档,即 Extra High,耗时明显减少,只用了 18 分钟完成。
相通的教唆词,DeepSeek 的成果是这么的。

而在 Peter Gostev 视频里,Fable 5 的成果和 GPT-5.6 Sol 不相险阻。
这 63 个教唆词,看起来如故让 AI 生成一个网页,但 3D 网页要濒临的不啻是生成每一帧最好截图,还有性能和可运行性。
即使界面再密致,可一朝灵通就吃爆了电脑的 GPU 显卡渲染,电脑径直卡崩溃了,那也不是一个好模子应该生成的网页。
濒临长教唆词时,好的模子应该更懂得先保住场景主体、镜头、中枢动画和交互,再用要道化几何、粒子与分级细节补足限制感。
GPT-5.6 Sol 的表刻下咱们的测试中基本上不错胜任这些复杂的 3D 场景生成。
让咱们印象更深的是,GPT-5.6 Sol 完成责任的神气,它会先诡计通盘阵势,再拆分任务,让不同的 Agent 同期鼓动,经过中不休查验、修改,再把最终收尾整理成一份不错审核的 Diff。
就一个 3D 网页,它不错花两个多小时去完成。

但回过来想,咱们相比的究竟是模子身手,如故一次回答背后的时期、规画资源和互助限制?
两个小时所需要的 Token,换在一个 Plus 账户或者免费账户上,大略都会占据多数的周额度。速率快的模子更允洽试观点;耗时更久的 Agent,能把复杂阵势推得更远。两者都可能有价值,却很难被一个总分评释了了。
当模子驱动我方诡计、单干、返工和验收,一次生成便越来越像一支临时阵势组。选拔哪款模子,亦然在选拔一套出产神气。咱们不错 10 分钟拿到一个 demo,也不错给 Agent 几个小时,把它推到可寄托情状。
以后再问哪款模子最强,测试惟恐得多出一张工时/Token单。画面傍边应该写清寄托时期与资源参加,也要让东谈主知谈它经验了若干轮返工,灵通后能不可径直用。
咱们正在招募伙伴
简历送达邮箱 hr@ifanr.com
✉️ 邮件标题 「姓名+岗亭称呼」(请随简历附上阵势/作品或关系皆集)

