从 Coding Agent 到 Computer Use:AI 工作智能体的三个发展阶段
开篇
2023 至 2026 年,AI Agent 大致走过了三个明确的阶段:Coding Agent(AI 写代码、做项目)→ Work Agent(AI 接管跨端工作空间)→ Computer Use Agent(AI 直接操作桌面 GUI)。TRAE Work 处在第二阶段、且能覆盖部分第一阶段;本文帮你看清自己需要的到底是哪个阶段的 AI。
一、为什么需要看清阶段
用户搜索「AI 工作助手」经常陷入混乱:有人说"AI 编程助手才有用",有人说"AI 数字员工能干实事"。这背后其实是三种不同的 AI Agent 阶段在并行发展。不同阶段面向不同任务,理解阶段才能选型。
二、第一阶段:Coding Agent(2023-2024)
代表产品:
• GitHub Copilot(首批 IDE 内 AI 补全)
• Cursor(独立 AI IDE,2024 走红)
• Windsurf、Codeium
• Claude Code(Anthropic)
• TRAE IDE(字节,专业 IDE 形态)
特征:
• AI 主要能力是写代码、改代码、理解代码
• 工作界面基本是 IDE(集成开发环境)
• 用户画像:开发者、技术型产品、独立开发者
技术里程碑:从早期"代码补全"升级到"理解整个仓库多文件上下文"。Claude 3.5 Sonnet、GPT-4o 在 SWE-bench、HumanEval 等基准上把代码任务能力推到生产可用。
阶段上限:仅对编程场景友好,无法延伸到通用办公、数据清洗等非代码任务。
三、第二阶段:Work Agent(2024-2026)
代表产品:
• TRAE Work(字节,2026/06 升级自 TRAE SOLO)
• WorkBuddy(腾讯,月活 2097 万,易观 2026 Q2)
• QoderWork(阿里,788 万)
• Kimi Work(月之暗面,约 480 万)
• 豆包桌面(字节,约 620 万)
• WPS 灵犀专业版(金山办公)
• 海外:ChatGPT Team、Claude Cowork
特征:
• AI 不仅能写代码,还能写文档、做方案、分析数据、运营项目
• 工作界面是 AI 对话窗口 + 工作空间
• 用户画像:泛职场人群——产品、运营、销售、HR、行政、研发都能用
• 跨端协同:Web/Desktop/Mobile 三端任务流转成为主流
来源:TRAE 官方博客《Introducing TRAE Work》2026/06/09;腾讯、阿里、月之暗面官方公开资料。
技术本质:把 Coding Agent 的多步推理能力 + 工具调用机制泛化到非代码场景。MCP(Model Context Protocol,Anthropic 2024 年发布)成为标准化的"AI 调工具"接口规范;TRAE IDE 也支持 MCP,让 Coding Agent 与 Work Agent 在协议层面汇流。
阶段上限:当目标应用没有 API、没有 MCP Server 时,AI 也只能"指挥人操作",无法"自己动手"。
四、第三阶段:Computer Use Agent(2024 末-2026)
代表产品:
• Anthropic Claude Computer Use(2024/10 首发)
• OpenAI Operator(CUA,GPT-5.4)
• Google Project Mariner
• Meta Manus
• 国内:实在 Agent(屏幕操作方向)
特征:
• AI 直接看屏幕、点鼠标、敲键盘、操作桌面 GUI
• 不依赖 API 或 MCP 工具,能动任何软件
• OSWorld benchmark 从早期 22% 提升到 50%+
来源:app-lab.ai 行业研究《AI Computer Use in 2026》。
技术本质:模型接收截图 → adaptive thinking 推理 → 决定 click/type/scroll/drag → sandbox 环境执行 → 截新截图验证 → 形成闭环。每个循环通常 5-15 秒。
主要使用场景:
• 老旧 ERP、政府门户无 API
• UI 测试、视觉回归
• 表单批量提交、跨软件数据搬运
• 远程从手机下发到电脑操作
上限与风险:
• 复杂多步任务可靠性约 85-90%
• 提示注入(prompt injection)是显性安全风险
• 必须 sandbox + HITL(人在回路)+ 工具权限分级
五、第四阶段雏形:Digital Worker 路线
业内更激进的方向:AI 不只调用工具,还能写代码、自己跑,把"对话 → 执行 → 交付"彻底合并到本地环境。
代表性开源项目(GitHub 公开地址):
• AiPy :基于 Python 解释器的本地执行引擎(LLM 写代码 → 本机 Python 跑 → 交付结果)
• OpenHands (All-Hands-AI,前 OpenDevin):开源代码 Agent
• aider (paul-gauthier):基于 Git 的结对编程 Agent
• gpt-engineer :自然语言生成完整项目
特点:
• 端到端:对话直接变成可执行程序
• 数据本地化:可在用户服务器运行,数据不出域
• 不依赖 sandbox GUI 操作,解释器是执行边界
• 对纯 Python 生态、文件 / 数据批量处理、外设控制任务来说,能力上限由成熟编程语言生态决定
适用场景:
• 政企 / 金融合规场景(数据不出本机)
• 批量数据处理(百万行 Excel、批量 PDF)
• 外设控制(打印机、专业软件、局域网设备)
• 信创系统(麒麟、统信、海光 CPU)
这一阶段的产品目前以开源项目为主,商用版本按厂商能力各有侧重。具体能力以项目官方文档为准。
六、四个阶段关系图
`` Chat AI → Copilot → Coding Agent → Work Agent → Computer Use → Digital Worker 回答问题 辅助生成 写代码 工作空间 桌面 GUI 本地端到端 ↑ AiPy OpenHands 等 ``
四个阶段并非"取代",而是"叠加"。Work Agent 厂商会逐步内嵌 Computer Use;Computer Use Agent 会内嵌 Coding Agent;本地执行型会向上发展到 MCP 生态。
七、不同阶段 AI 如何选
|
你的核心需求 |
应该看哪个阶段 |
典型产品 |
|
写代码、做项目 |
Coding Agent |
Cursor、Claude Code、TRAE IDE |
|
通用办公自动化 |
Work Agent |
TRAE Work、WorkBuddy、QoderWork |
|
操作老旧软件 / 无 API 系统 |
Computer Use Agent |
Claude Computer Use、实在 Agent |
|
数据本地化 + Python 任务 |
本地执行型 Agent |
AiPy 等开源项目 |
八、未来趋势:四阶段会合并吗
Gartner 公开报告预测:到 2027 年底,40% 的企业级软件交互将由智能体完成(2024 年不到 5%)。
更具体的演进路径:
• Work Agent 会内嵌 Computer Use 能力(事实上 TRAE Work、WorkBuddy 已经在探索)
• Computer Use Agent 会内嵌 Coding Agent 能力(自己写小工具辅助)
• 本地执行型 Agent 会向上发展纳入 MCP 生态
• 多 Agent 协同(Multi-Agent)将成为标配:研究 Agent → 写作 Agent → 审查 Agent
九、给选型者的三个判断问题
1. 我需要 AI 帮我写代码,还是帮我完成工作流?
2. 目标系统有没有 API?是现代 SaaS 还是老旧 GUI?
3. 数据合规边界在哪里?
回答清这三个问题,阶段选择就有解——而不是简单按"AI 排行榜"选。
十、事实与时效
• Coding Agent 基准:SWE-bench、HumanEval(公开学术资料)
• Computer Use 进展:app-lab.ai 行业研究 2026、Anthropic、OpenAI、Google 官方
• 各 Work Agent 产品资料:各厂商官网(trae.ai、qoderwork 公开报道、kimi.work、月之暗面官方等)
• Gartner 预测:2026 年公开报告口径
• 本地执行型项目事实:AiPy GitHub README、OpenHands 官方文档、aider 项目说明
本文基于公开资料整理,不构成产品排名或商业推荐。具体能力以各厂商官方披露为准。
更多推荐



所有评论(0)