GPT-6的“手脚”已备好:代码库泄露关键运行环境
最近,OpenAI的官方GitHub代码仓库里出现了一些引人注目的新内容。一位开发者在名为“Computer Use”的示例项目提交了代码更新,新增了两个专门的环境配置:“gpt6-js-image”和“gpt6-py-image”。更关键的是,这些代码所在的分支被直接命名为“codex/gpt6-computer-use-images”。
尽管这份代码更新尚未被合并到主分支,里面也没有任何调用GPT-6模型API的痕迹,但它明确地指向一件事:OpenAI正在为GPT-6模型准备与计算机深度交互的“操作平台”。
双环境配置:让AI真正“动手”操作
这两套环境分别针对不同的编程语言和操作场景搭建:
- gpt6-js-image环境:为JavaScript设计,预装了Playwright测试框架和Chromium浏览器内核。这为AI在网页环境中的自动化操作铺平了道路。
- gpt6-py-image环境:为Python设计,集成了PyAutoGUI(图形用户界面自动化工具)、Chromium以及一套Linux桌面环境。这意味着AI将能“看到”屏幕内容,并模拟鼠标、键盘操作,控制浏览器乃至整个桌面应用。
从技术栈的选择来看,OpenAI的目标非常清晰——让未来的GPT-6不仅是一个对话或代码生成的工具,更是一个能直接接管电脑、执行复杂任务的智能体。
Sam Altman的“Astra”愿景:操作流畅度媲美人类
OpenAI首席执行官Sam Altman在近期的一次访谈中,似乎提前剧透了这一发展方向。他提到,过去让AI模型操作电脑的尝试,效果总是“太慢”或“不好用”。但现在,情况完全不同了。
他特别提到了一个内部代号为“Astra”的能力。Altman表示,Astra让他第一次感觉到,AI操作电脑的流畅度和效率“已经达到和人类差不多的水平”。他甚至透露,自己现在会直接让模型去不同的应用程序里查找信息,而不是亲自一个个打开搜索。
这番描述,恰好与GitHub上泄露的“Computer Use”环境代码相呼应。Altman口中的“Astra”,很可能就是GPT-6将具备的这种革命性的计算机操作能力。
从“思考”到“行动”:AI交互范式的转折点
这次代码泄露和CEO的言论,共同指向AI发展的一个重要转折。长期以来,大语言模型主要停留在信息处理和内容生成的层面。而GPT-6可能带来的“Computer Use”能力,意味着AI将突破数字世界的“旁观者”角色,转变为能够主动执行、操控软件的“行动者”。
这不仅仅是技术上的进步,更是交互范式的根本改变。当AI可以像熟练的用户一样操作各种软件时,自动化办公、复杂工作流管理、甚至个性化的电脑助手都将进入一个全新的阶段。我们等待的或许不再是一个更聪明的聊天机器人,而是一个真正能坐在电脑前,帮你处理一切事务的数字同事。