卡帕西又整新活了:100 万 token 让 AI 把《指环王》开头做成 3D 世界
技术笔记 11 次阅读

卡帕西又整新活了:100 万 token 让 AI 把《指环王》开头做成 3D 世界

卡帕西又整新活了:100 万 token 让 AI 把《指环王》开头做成 3D 世界

OpenAI 联合创始人卡帕西(Andrej Karpathy)最近在 X 上发了个挺有意思的想法:与其天天让 AI 画鹈鹕骑车图,不如直接给它一段文学作品的文字,让它建一个能交互的 3D 世界出来。

这个思路其实挺刁钻的。以前大家测大模型的空间推理和代码能力,爱用"生成一张鹈鹕骑自行车的 SVG 图"这种任务,因为一张图里既要理解空间关系,又要写对几何代码,还得能跑起来。但卡帕西觉得,这点难度对现在的模型来说已经不够看了,得往上加码。

于是他搞了个新基准:给模型《指环王》开篇的第一段文字,让它用 three.js 搭一个对应的 3D 场景。预算上限是 100 万 token,换算下来大概 10 美元的成本。

实测下来,Claude Opus 5 在这个任务上花了大约两个小时,输出了 5500 行代码,最后做出来的东西包含比尔博的告别宴会、堆满财宝的洞穴这些《指环王》开场名场面,而且是以 3D 动画的形式呈现的。要说跟人工花几十个小时精雕细琢的作品比,那肯定还有差距,但考虑到这是 AI 两小时内从一段纯文字里"无中生有"出来的,完成度已经相当能打了。

这事有意思的地方在于,它把好几项能力一次性串起来了:文学文本的理解、场景的空间想象、three.js 的代码生成、还有多媒体呈现。单一维度测,模型可能都拿高分,但组合起来就很容易露馅——文字读懂了不代表能想象出空间,想象出空间了不代表能写出对的代码,写对代码了还不一定能渲染出像样的画面。任何一个环节掉链子,整个任务就崩了。

这其实也反映了现在大模型评测的一个趋势:单点刷分越来越没意义,大家开始追求"端到端"的综合任务。卡帕西这种拿文学名著当输入的做法,好处是任务本身足够复杂、足够开放,模型没法靠背题库蒙混过关;坏处是结果很难量化打分,最后可能还是得靠人眼判断"像不像那么回事"。

不管怎么说,100 万 token、5500 行代码、两小时出成品,这个量级放在两年前是想都不敢想的。下次再有人说 AI 写代码不行,可以把这段甩给他看:人家都能从一段小说文字里给你搭出一个中土世界了。

分享

评论 (0)

评论通过后显示

暂无评论,来写第一条吧 ✍️