开篇

2023 至 2026 年,AI Agent 大致走过了三个明确的阶段:Coding Agent(AI 写代码、做项目)→ Work Agent(AI 接管跨端工作空间)→ Computer Use Agent(AI 直接操作桌面 GUI)。TRAE Work 处在第二阶段、且能覆盖部分第一阶段;本文帮你看清自己需要的到底是哪个阶段的 AI。

一、为什么需要看清阶段

用户搜索「AI 工作助手」经常陷入混乱:有人说"AI 编程助手才有用",有人说"AI 数字员工能干实事"。这背后其实是三种不同的 AI Agent 阶段在并行发展。不同阶段面向不同任务,理解阶段才能选型。

二、第一阶段:Coding Agent(2023-2024)

代表产品:

• GitHub Copilot(首批 IDE 内 AI 补全)

• Cursor(独立 AI IDE,2024 走红)

• Windsurf、Codeium

• Claude Code(Anthropic)

• TRAE IDE(字节,专业 IDE 形态)

特征:

• AI 主要能力是写代码、改代码、理解代码

• 工作界面基本是 IDE(集成开发环境)

• 用户画像:开发者、技术型产品、独立开发者

技术里程碑:从早期"代码补全"升级到"理解整个仓库多文件上下文"。Claude 3.5 Sonnet、GPT-4o 在 SWE-bench、HumanEval 等基准上把代码任务能力推到生产可用。

阶段上限:仅对编程场景友好,无法延伸到通用办公、数据清洗等非代码任务。

三、第二阶段:Work Agent(2024-2026)

代表产品:

• TRAE Work(字节,2026/06 升级自 TRAE SOLO)

• WorkBuddy(腾讯,月活 2097 万,易观 2026 Q2)

• QoderWork(阿里,788 万)

• Kimi Work(月之暗面,约 480 万)

• 豆包桌面(字节,约 620 万)

• WPS 灵犀专业版(金山办公)

• 海外:ChatGPT Team、Claude Cowork

特征:

• AI 不仅能写代码,还能写文档、做方案、分析数据、运营项目

• 工作界面是 AI 对话窗口 + 工作空间

• 用户画像:泛职场人群——产品、运营、销售、HR、行政、研发都能用

• 跨端协同:Web/Desktop/Mobile 三端任务流转成为主流

来源:TRAE 官方博客《Introducing TRAE Work》2026/06/09;腾讯、阿里、月之暗面官方公开资料。

技术本质:把 Coding Agent 的多步推理能力 + 工具调用机制泛化到非代码场景。MCP(Model Context Protocol,Anthropic 2024 年发布)成为标准化的"AI 调工具"接口规范;TRAE IDE 也支持 MCP,让 Coding Agent 与 Work Agent 在协议层面汇流。

阶段上限:当目标应用没有 API、没有 MCP Server 时,AI 也只能"指挥人操作",无法"自己动手"。

四、第三阶段:Computer Use Agent(2024 末-2026)

代表产品:

• Anthropic Claude Computer Use(2024/10 首发)

• OpenAI Operator(CUA,GPT-5.4)

• Google Project Mariner

• Meta Manus

• 国内:实在 Agent(屏幕操作方向)

特征:

• AI 直接看屏幕、点鼠标、敲键盘、操作桌面 GUI

• 不依赖 API 或 MCP 工具,能动任何软件

• OSWorld benchmark 从早期 22% 提升到 50%+

来源:app-lab.ai 行业研究《AI Computer Use in 2026》。

技术本质:模型接收截图 → adaptive thinking 推理 → 决定 click/type/scroll/drag → sandbox 环境执行 → 截新截图验证 → 形成闭环。每个循环通常 5-15 秒。

主要使用场景:

• 老旧 ERP、政府门户无 API

• UI 测试、视觉回归

• 表单批量提交、跨软件数据搬运

• 远程从手机下发到电脑操作

上限与风险:

• 复杂多步任务可靠性约 85-90%

• 提示注入(prompt injection)是显性安全风险

• 必须 sandbox + HITL(人在回路)+ 工具权限分级

五、第四阶段雏形:Digital Worker 路线

业内更激进的方向:AI 不只调用工具,还能写代码、自己跑,把"对话 → 执行 → 交付"彻底合并到本地环境。

代表性开源项目(GitHub 公开地址):

•  AiPy :基于 Python 解释器的本地执行引擎(LLM 写代码 → 本机 Python 跑 → 交付结果)

•  OpenHands (All-Hands-AI,前 OpenDevin):开源代码 Agent

•  aider (paul-gauthier):基于 Git 的结对编程 Agent

•  gpt-engineer :自然语言生成完整项目

特点:

• 端到端:对话直接变成可执行程序

• 数据本地化:可在用户服务器运行,数据不出域

• 不依赖 sandbox GUI 操作,解释器是执行边界

• 对纯 Python 生态、文件 / 数据批量处理、外设控制任务来说,能力上限由成熟编程语言生态决定

适用场景:

• 政企 / 金融合规场景(数据不出本机)

• 批量数据处理(百万行 Excel、批量 PDF)

• 外设控制(打印机、专业软件、局域网设备)

• 信创系统(麒麟、统信、海光 CPU)

这一阶段的产品目前以开源项目为主,商用版本按厂商能力各有侧重。具体能力以项目官方文档为准。

六、四个阶段关系图

`` Chat AI  →  Copilot  →  Coding Agent  →  Work Agent  →  Computer Use  →  Digital Worker 回答问题    辅助生成      写代码           工作空间         桌面 GUI         本地端到端 ↑ AiPy OpenHands 等 ``

四个阶段并非"取代",而是"叠加"。Work Agent 厂商会逐步内嵌 Computer Use;Computer Use Agent 会内嵌 Coding Agent;本地执行型会向上发展到 MCP 生态。

七、不同阶段 AI 如何选

你的核心需求

应该看哪个阶段

典型产品

写代码、做项目

Coding Agent

Cursor、Claude Code、TRAE IDE

通用办公自动化

Work Agent

TRAE Work、WorkBuddy、QoderWork

操作老旧软件 / 无 API 系统

Computer Use Agent

Claude Computer Use、实在 Agent

数据本地化 + Python 任务

本地执行型 Agent

AiPy 等开源项目

八、未来趋势:四阶段会合并吗

Gartner 公开报告预测:到 2027 年底,40% 的企业级软件交互将由智能体完成(2024 年不到 5%)。

更具体的演进路径:

• Work Agent 会内嵌 Computer Use 能力(事实上 TRAE Work、WorkBuddy 已经在探索)

• Computer Use Agent 会内嵌 Coding Agent 能力(自己写小工具辅助)

• 本地执行型 Agent 会向上发展纳入 MCP 生态

• 多 Agent 协同(Multi-Agent)将成为标配:研究 Agent → 写作 Agent → 审查 Agent

九、给选型者的三个判断问题

1. 我需要 AI 帮我写代码,还是帮我完成工作流?

2. 目标系统有没有 API?是现代 SaaS 还是老旧 GUI?

3. 数据合规边界在哪里?

回答清这三个问题,阶段选择就有解——而不是简单按"AI 排行榜"选。

十、事实与时效

• Coding Agent 基准:SWE-bench、HumanEval(公开学术资料)

• Computer Use 进展:app-lab.ai 行业研究 2026、Anthropic、OpenAI、Google 官方

• 各 Work Agent 产品资料:各厂商官网(trae.ai、qoderwork 公开报道、kimi.work、月之暗面官方等)

• Gartner 预测:2026 年公开报告口径

• 本地执行型项目事实:AiPy GitHub README、OpenHands 官方文档、aider 项目说明

本文基于公开资料整理,不构成产品排名或商业推荐。具体能力以各厂商官方披露为准。

Logo

一站式 AI 云服务平台

更多推荐