Swimming as fast as we can...
Swimming as fast as we can...
No summary in your language yet — showing the existing version.
作者实测 GPT-6 的 Computer Use 在 Blender 中操作,经历 Agent 模式选择、macOS 系统升级等卡点后,发现它并不像人类那样看屏幕、点鼠标建模。
在 Keynote 里画神经网络时虽然出现了 GUI 点击,但追踪底层发现 Computer Use 有明确的优先级。
作者指出,网上许多酷炫 3D 视频可能用 HTML 或 Three.js 完成。不过他认为 Computer Use 的能力正在提升,已经能较丝滑地完成三维创作。
作者强调,模型并非只会硬生生地读屏幕操作,而是会优先选择更高效的 MCP、CLI、API 或脚本等方式,这种选择本身就是智能的体现。
This transcript is not in English — you can generate an English translation: read the whole piece, or check it line by line against the original.
GPT6与Blender爆火 最近GPT6加Blender生成的视频在网上遍地都是。甚至把原本只有3D建模式用的这个Blender软件都给带火了。但其实这里我有一个很大的困惑。那我们稍后再说。我也用GPT6根据我家的图片生成了一个第一视角游戏。那我在让它调色之后,发现跟我家实在是太像了。我都不敢放完整的视频了。那我还用简简单单的两行提示词,复刻了网上的经典的泳池别墅。那真的就是两行提示词。与此同时,GPT6的Computer Use功能,也就是操作电脑,好像成为了最大的功臣。那这也是OpenAI在宣传业上特别强大的一个重大提升点。GPT6,Computer Use,Blender,这三个原本不怎么大尬的词,这回算是彻底关联在了一起。那看到这儿,你的第一直觉是不是这样的?GPT6用强大的Computer Use功能,打开了Blender这个软件,像人一样看屏幕,点鼠标,按键盘,一顿操作猛龙虎之后,一个酷炫的3D模型就建出来了。就像亲眼看到一个人类建筑师几个小时的创作过程一样。那我们再往后推,可能就是CRI已死,MCP已死,GUI当立这种言论了。但事实真的是这样吗? 实测GPT6操作Blender 看完这期视频,你会发现它和你直觉上的理解可能是不同的,甚至是相反的。今天就不搞那么多理论铺垫了,我们直接开干。打开Codex,切换成,诶,这个GPT6呢?我高贵的20倍Pro会员都用不了吗?哦,原来这里要选择工作,也就是Agent的模式才有。这是我遇到的第一个卡。然后我打开Blender。把它和Codex放在一起,方便大家来观看。直接一句话,给我在Blender里面画个球。诶,什么电脑控制服务启动失败。这啥意思?哦,我问了一下Codex。原来是我的MacOS系统版本过低了。于是呢,我各种升级系统,冲击电脑,这样几个小时就过去了。这就是我遇到的第二个卡。这回应该没有问题了吧?同样的提示词再来一遍。诶,好像看起来正常了。开始欣赏我们的GPT操作电脑吧。诶,等会等会。你怎么开始写上代码了?说好的在屏幕上酷炫的点点点呢?当然了,最后他确实成功画了个球。但这个过程怎么和我想的不太一样呢? 生成过程的真实情况 这就是我遇到的第三个卡。肯定是我这个任务太简单了吧。我给他选个难点了吧。这个网站记录了很多,又大模型生成的3D案例。还贴心的附上了提示词。我操这什么鬼?那我就选最近的一个非常经典的永世别墅。直接把这个提示词粘贴过来。发射。接下来我用100倍速给大家播放。诶,不是不是。怎么看着大部分还是代码呀?我去。最后这个模型就直接闪现出来了。然后我让他直接导出一段视频给我。最终的效果就是这样子。当然因为我这里用的是Mac电脑。所以就不带大家在Blender里面查看了。否则基本上就是卡成PBT了。实际上房间的各种家具的细节都是非常精致的。那这是怎么回事呢?为什么没有出现我们刚刚想象中的那种场景呢?那我们详细回看一下他完成这个任务的过程。首先第一步就是查看当前的Blender工程。也就是定位到了我们这个Blender程序。然后呢又查看了三维视图。就是用了个屏幕截图。那看完这个屏幕截图之后,就应该开始点点点了吧?但是这里的第一步居然是打开Blender场景脚本控制台。啊,这第一步就直接开始写脚本了。然后再往后他看了一眼Blender控制台的屏幕截图。发现已经密密麻麻全是脚本了。然后再往后发现别墅已经生成并保存了。包含了650个场景对象。所以他就是从第二步开始就直接写脚本了。唯一有一点GUI交互的,就是点到这个脚本控制台里面而已。 Blender脚本控制台 那这是不是跟你想的又完全不一样?那这个Blender脚本控制台是什么呢?非常简单。其实你打开Blender之后。这里面就有个叫脚本的东西。点开它之后,你就可以在这里面输入代码了。这格式跟Python差不多。比如说我们输入这么一行东西,它就可以在画面中心直接画出个球。然后我们再改一下里面的坐标啊、大小啊等等。然后再来回车,它就会直接生成另一个球。也就是说,在刚刚这个场景里面,有几百个对象啊、家居啊、泳池啊等等。全都是通过这么一大堆脚本创建的。根本就不是什么鼠标在屏幕上点点点。看到这里,不知道你有什么感觉。反正我是有两种情绪的。第一就是,大模型果然还是擅长处理文本啊。我就说嘛,怎么可能用电脑GUI,把这么复杂的模型给画出来的?那得多浪费token啊。 非人类操作的震撼 但另外一种情绪就是。空行占位1空行占位2空行占位3空行占位4空行占位5空行占位6空行占位7空行占位8空行占位9空行占位10空行占位11空行占位12空行占位13空行占位14空行占位15 效率远超人类 这也太离谱了。这种操作不是更像非人类的操作吗?就单论这个最终的成果来看,这绝对就是对人类通过视觉操作的一种降维打击啊!没有人搞这种东西,完全是通过一行一行脚本去弄的。但大模型却认为这种方式是更简单的,更擅长一些。你说这不是非人类吗? 尝试用GPT6操作Keynote 当然了。我还是希望看到GPT6对着屏幕点点点,这种效果。于是呢,我就选择了自己非常擅长也更简单的Keynote,Windows上就叫PPT。我的视频动画全都是用这玩意做的。然后呢,我让GPT6帮我在上面画个简单的神经网络。其实这个东西如果是我自己手动画的话,还真是有点浪费时间。因为都是重复性的,还需要精确点击到准确的位置。对大模型来说应该是很擅长的。那可以看到,这回它真的是拿着鼠标各种点点点了,帮我一笔一笔地把它画出来。中间还画错了两根线。不过呢,它最后自查了一下,然后给纠正好了。好了。这回终于是看到了我们想要的结果了。这回它就是不断读取屏幕,然后理解屏幕上的内容,然后精确的控制鼠标点击到各种的位置吧。好了。那本期视频到底也结束了。拜拜。我又回来了。因为我要one more thing一下了。它真的是看屏幕,然后找到那些按钮的位置,然后点点点的吗? 追溯操作背后的原理 那我们就再详细追溯一下这个过程的详情。可以看到它整体的思路是没有问题的。那这次呢,我们更细致的看一下,它第一步到底做了什么。和刚刚的blender一样,这里仍然是一个什么叫查看keynote的东西。然后具体的返回值,是一段又臭又长的文本。刚刚我没有看。当然在这个页面操作实在是太不方便了所以我直接让AI把所有的对话细节做成了一个html页面这就非常清晰了那我们在这里直接看看刚刚那段又臭又长的文本吧可以看到它调用了一个叫getapp的方法传入了一个名字就叫keynote很显然就是查看keynote这个软件的一些当前什么状态信息然后呢就是输出了一大堆文字当然这里面我下面加了一个中文翻译的部分我们来详细阅读一下电脑操作就是computer use看来是给computer use的一个工具说明类似于skill通过读取或操作用户页面控制用户电脑上的原生应用和浏览器这不就是我们直观理解上的那个GUI操作吗有专用连接器API或命令行工具时优先使用它们那这句话的信息量就很大了其实操作一个软件我们知道既可以通过mcp也可以通过cli也可以通过各种脚本当然也可以使用人类看起来最直观的这个GUI这几个blender全都支持而这句话就是在告诉我们其实GUI这种方式是排在前面所有这些方式之后的是一个迫不得已式的备用选择那这也就是刚刚为什么在blender里面仍然优先采用脚本的方式进行的原因然后再往后就是告诉大模型如果你想要操作电脑的话就使用我这些接口比如说获取屏幕的截图复制粘贴拖拽按下按键等等等等然后我们再看下面这个描述执行一个或多个界面后在决定下一步之前调用getaxstate这个方法这样可以掌握当前页面的状态并从最新的无障碍文本中重新获取元素所以避免沿用过期所以诶, 关键工具说明 这看来还没完。这句话又是一个信息量很大的话。也就是说,即使我们必须用电脑的GUI来操作,那么也需要先调用一个叫getaxstate这么一个函数。它会返回一个什么无障碍文本。那它是什么东西呢?其实这个无障碍文本,就是第二段这个文字输出的内容。聪明的你一看就知道了,这应该就是对Keynote一个布局的文字描述嘛,也就是所谓的无障碍文本了。那可以看到有非常非常非常多的信息。相当于你把屏幕看到的结构,以树状的形式给表达出来了。接下来所有的步骤都是优先调用了这个方法,拿到屏幕的文字描述。而且这里还很聪明的用了增量描述的方法,节省了token。那这个无障碍文本是从哪里来的呢?其实这个东西我们都非常非常熟悉。就在Mac电脑上有个叫辅助功能的权限,也可以叫做无障碍。比如说这个codex的computer use就打开了这个权限。而这个功能就是帮助有障碍的人,比如说视觉障碍来了解屏幕的内容的。比较直观的是你可以点开这个旁白。那是不是很好理解了?它其实就是把屏幕中的信息读出来,给视障人士或者不方便看屏幕的人准备的。而这个能力更底层就是依赖苹果官方的AX接口,也就是刚刚我们看到的,返回了类似树状结构的屏幕信息的接口。当然了这个接口肯定实现起来,就不是大模型的什么多模态视觉能力了。它直接就是各个APP自己内部提供的,对接了苹果的这个无障碍。那就非常非常简单了。所以呢,其实刚刚我们看到的GPT6,花里胡哨的操作Keynote这个过程,其实底层大部分还是基于纯文本的信息理解,根本就没有直接去看屏幕上的内容。而且这个纯文本的信息,还非常聪明的以增量描述的方法,再次节省了大量token。 无障碍文本的真相 这块跟你理解的是不是又有偏差了?还没完。最后再说一点。这可能跟你想象的还是不一样。就是很多网上的素材,连操作的软件都不一定是blender。比如说我视频开头生成的,这个自己家的3D画面,其实我就只是在XGBT的网页端,把我家的图片上传了一堆,然后就做出来了。它实际上是一个纯HTML文本,使用的GS库就是大名鼎鼎的3.js,是一个3D库。最终加载渲染的速度也都非常快,可以直接上手做成一个第一视角游戏。这个HTML页面就更是一个纯文本的信息了。所以你看其实网上很多的这个比较酷炫的视频,它就不一定是用blender做的。那即使是用blender做的,也不一定是手动点屏幕操作的blender,更多的可能是CRI啊,MCP啊,或者说脚本操作等等。所以其实这次GPT6和blender火出圈,那我觉得一方面原因,肯定是它的computer use能力有了大幅的提升。因为我也是了其他家的agent产品,是做不出这样的效果的。另一方面我觉得是,它的computer use能力,刚好达到了一定的预值。就是说可以一次性的,非常丝滑的,没有中间卡点的,完成人们创作一个三维作品的想象。而这个能力还需要综合它的其他方面的能力,共同实现这个效果。然后还有就是我觉得这个computer use能力设计的,也非常合理。就是人们直观上理解的computer use的优先级,其实是低于MCP CRI API或者脚本去操作的。这也说明了大墨星其实还是更擅长跟blender交道。它处理的逻辑就是跟人不一样,而且效率会更高。之前我也有一期视频演示着通过Apple Script,去操作Keynote的一个过程。其实画神经网络这个事,也可以通过这个脚本来实现。那可能它评估了之后,发现直接用MacOS提供的一个辅助功能,可能更方便一些。这也正是它智能的体现。不是说所有的操作都要硬生生地去读屏幕。可以看到,除了读屏幕之外,还有非常非常多的模型更擅长的方式去处理。 总结与误区 好了,本期视频到这里就真正结束了。其实更多的是想更正很多人的一些误区。GPT6的能力确实是非常非常强,但很多人把它的强大仅仅归结于狭义上的Computer Use。然后又有很多人把Computer Use的强大仅仅理解成他们脑海中想象的那种,看屏幕、读屏幕、操作屏幕的样子。那这个时候你在看很多言论,说GUI当立,CRI脚本API已死这种言论,是不是就非常可笑了?相反,它们反而是越来越重要了。不信,打,遗终,这是,费念,有,对,在,这,是,想。