玩命加载中...
玩命加载中...
哔哩哔哩飞天闪客11:05
Computer Use 优先调用 MCP、CLI、API 或脚本,GUI 是备选,底层主要基于文本而非真正“看屏幕”,网上很多结果也并非 Blender 手点操作。

▶基于 136 个镜头,识别出 8 个关键章节;选择章节可在这里查看对应分析。
视频从 GPT-6 加 Blender 生成视频走红的现象切入,作者实测用 Codex 操作 Blender 和 Keynote。Blender 建模并非像人一样点击 GUI,而是直接写 Python 脚本;Keynote 看似点击,实际靠 getAXState 读取无障碍树文本。结论:Computer Use 优先调用 MCP、CLI、API 或脚本,GUI 是备选,底层主要基于文本而非真正“看屏幕”,网上很多结果也并非 Blender 手点操作。
38 根评论 / 49 回复
170 条弹幕
135 / 136 帧覆盖
136 镜头浏览器 · 135 / 136 帧有画面标注 · 12 拼图
按视频时间线查看重点和观众反应。
分清事实、结论与适用边界,再回到字幕原文。

评论区主要围绕 Computer Use 的实际工作方式展开讨论,观众分享真实体验,指出其优先使用 MCP/CLI/API,而非真正“看屏幕”,并对 Windows 和 Mac 的体验差异进行争论。有观众质疑后台操作是否真的属于 Computer Use,另有讨论聚焦于 GUI 对 AI 的低效性,以及 AI 是否应具备操作 GUI 的能力。部分观众表达了对视频内容的赞赏,认为其揭示了营销号的夸大宣传。整体讨论技术性强,但缺乏大范围争议或纠错。
因为这个鼠标操作实际上非常慢,而且会占用整台电脑的操作权,在他操作电脑的时候你什么都做不了,包括他自己想做其他任务也会受影响,所以一般情况下他都不会用,除非其他手段无法完成,我让他建模,他blender甚至都不需要打开,有专门的隐形后台处理的
286 赞
操作确实会非常慢,但是它其实不会占用电脑的操作权,因为它是在沙箱里面控制另一个鼠标。
回复 · 128 赞
回复 @飞天闪客 : 在 Windows 中会占用的
回复 · 14 赞
回复 @飞天闪客 : 可能是MAC得原因,WIN系统目前还是会占用主界面来操作
回复 · 4 赞
回复 @琉璃迭梦 :Win系统前两三天也不会占用了。我一直更新最新版,某次更新后Computer Use变成完全静默的了。
回复 · 2 赞
回复 @MG今天也在沉迷吸龙 : 会占用的。整个画面是蓝色的,这时候你如果做其他操作,Computer Use会暂停,等你不做其他操作了,他才会继续自己的任务
回复 · 0 赞
GUI本身就是为了照顾人类发展出了“直观”但“低效”的操作方式,GUI操作的背后还是执行指令
28 赞
GUI是给人用的,对于AI(或计算机)来说, GUII是一种低效的操作方式,代码或指令的效率更高 所以如果一个AI能够高效率的操作GUI,那么他使用代码或命令行的效率只会更高,两者的差距会更大 这就产生了一个悖论 AI操作GUI的效率越高,AI的效率越低(什么鱼越大鱼越小[笑哭][笑哭])
24 赞
回复 @难受的西瓜皮 :但是反过来说也同理🤔:GUI图形界面并不是每个软件都有,但命令行肯定是都有的(尤其是AI普及之后);AI操作GUI只能说是对旧有面向人类设计软件的妥协;人类造物可以模仿人类,但并非必须模仿法令纹;更何况CLI甚至可以说只要有文档完全没有学习门槛,更不存在迁移门槛。
回复 · 2 赞
回复 @二零醚酱 : 你说的还是机器逻辑,其实你说的也对,但不是AGI的目标,AGI是让机器拥有与人类相当的、全面的智能水平,人能做,ai就要能做,这是第一步。agent可以通过cli操作所有软件,但是以结果为目标并不能学习过程,即设计意图,通过GUI学习的正是意图。这也是ai写的长代码会有屎山的问题的原因,他是以这个test是否pass了为目标设计的。话说回来,当然所有的设计意图操作步骤也可以用code的形式写出,但是还是训练数据的原因,只有很少一部分人是用cli来控制软件的吧?所以GUI的出发点是为了学习人类操作模式,落脚点是训练数据。你说的机器逻辑,并不是为了学习人类操作,而是是否达成目标,如果按这个逻辑想,最终应该去学习二进制编码。
回复 · 0 赞
我愿称为闪客为营销号终结者,每次一发新模型营销号就开始狂吹,我这次差点真的以为是模型操作gui的速度发生了质变,还有就是,我还真以为一句话就把游戏建模,引擎哪些都搭好了,原来还是一个网页
17 赞
虽然流量不太好,但质量真的很不错,千万要继续下去啊[打call]
30 赞
有个问题,如果不是在 macOS 上,也不是 Blender 这种能用 MCP 的软件,实际体验如何呢?很多国产内软件没提供无障碍接口。这样在 Windows 上操作会非常麻烦,据说 Windows 会抢键盘鼠标焦点
47 赞
终于有人问了!你帮我去探索一下吧哈哈!那这些应该就是直接看屏幕,然后点鼠标了,其实我用了其他家的一些 Agent,他们连操作 MacOS电脑上的 Blender 的时候,很多地方都是硬生生看屏幕,然后点鼠标,结果一团乱,点也点不准。我觉得这也是 GPT6 聪明的地方,就是他非常了解一个任务到底应该交由什么样的操作方式去处理。
回复 · 61 赞
豆包有虚拟屏幕的,我同学自动化专业,不太会AI,我就给他弄了豆包操作labview,豆包使用的虚拟屏幕不会干扰你的电脑操作,只是它要从零打开软件操作。使用你现在的屏幕也行,那就会抢鼠标了
回复 · 4 赞
回复 @MG今天也在沉迷吸龙 : 我懂你什么有意思,那个其实不是Computer Use,他就是调用了MCP和CLI在后台工作了,这个我知道,真正得Computer Use还是会全屏蓝色鼠标蓝色,你去操作得时候他就会暂停工作。你还没搞懂我说得意思。你工作得时候他之所以能够独立工作,是因为他压根没有用Computer Use。。。
回复 · 2 赞
我觉得还有个点你没讲明白,大模型完全不擅长点点点,即使支持多模态的大模型,大部分连按钮的坐标都无法精确输出,甚至错的离谱。
13 赞
那确实,点点的话,各个电脑分辨率都不一样,输出的点位坐标那确实也不够精准
回复 · 0 赞
就这么说吧,我让gpt6帮我把飞书的bug单改状态成已解决,他都花了十几分钟。然后我让他走浏览器cdp去写脚本,写完以后任何一个AI都能在10秒钟做完。computer use我感觉本质上还是写代码
3 赞
computer_use这是我接触ai之后第一个卸载的mcp,第二个是superpowers.除非你需要有明确避免rdp的风险,不然网页类的操作playwright可以全量代替
11 赞
但是代码指令并不是每个公司都会开放,这里缺乏数据会难以训练;用GUI虽然低效,但是是人类的工作方式,学习的是人类逻辑,这是符合AGI的第一性原理;就人类来说,如果会一种软件操作,应该能很快泛化到同类软件,这部分是是可以scale up的。
回复 · 0 赞
回复 @难受的西瓜皮 :但是反过来说也同理🤔:GUI图形界面并不是每个软件都有,但命令行肯定是都有的(尤其是AI普及之后);AI操作GUI只能说是对旧有面向人类设计软件的妥协;人类造物可以模仿人类,但并非必须模仿法令纹;更何况CLI甚至可以说只要有文档完全没有学习门槛,更不存在迁移门槛。
回复 · 2 赞
回复 @二零醚酱 : 你说的还是机器逻辑,其实你说的也对,但不是AGI的目标,AGI是让机器拥有与人类相当的、全面的智能水平,人能做,ai就要能做,这是第一步。agent可以通过cli操作所有软件,但是以结果为目标并不能学习过程,即设计意图,通过GUI学习的正是意图。这也是ai写的长代码会有屎山的问题的原因,他是以这个test是否pass了为目标设计的。话说回来,当然所有的设计意图操作步骤也可以用code的形式写出,但是还是训练数据的原因,只有很少一部分人是用cli来控制软件的吧?所以GUI的出发点是为了学习人类操作模式,落脚点是训练数据。你说的机器逻辑,并不是为了学习人类操作,而是是否达成目标,如果按这个逻辑想,最终应该去学习二进制编码。
回复 · 0 赞
操作确实会非常慢,但是它其实不会占用电脑的操作权,因为它是在沙箱里面控制另一个鼠标。
回复 · 128 赞
有木有可能虚拟化一个系统资源跟我们用户的是独立的 那边是AI在模拟屏幕点击 不影响你这边的工作 我还是觉得纯脚本语言的特化是没什么大意义的能力无法迁移 如果真的要AGI 视觉能力必然要达标 不然以后怎么用在具身智能之类的领域呢 现实世界哪有无障碍功能
回复 · 22 赞
原来我的优先级低于你,我就是 Computer Use
118 赞
盲人up太励志了,身残志坚坚持ai创作!!![支持]
3 赞
ⓘ 主题并非相互排斥;同一条评论可能涉及多个主题,因此各主题的评论数之和可能大于总数。
观众对Computer Use的技术实现表现出浓厚兴趣,围绕文本优先而非视觉识别的结论展开讨论,既有认同也有分歧,同时不乏幽默调侃和实用补充。

根据 379 段字幕、4,807 字计算