Background Agent 是一种接下任务后”自己读完仓库、改完代码、跑完测试、再以草稿 PR 形式交回”的 AI 编程代理;从 2024 年 Devin 走出原型到 2025 年 GitHub Copilot coding agent、OpenAI Codex、Cursor Background Agent、Claude Code 异步云端任务先后落地,AI 编程的工作形态已经由”我盯着它敲代码”切换为”我把 issue 指派给它”。它真正改变的,是开发者从”逐行陪伴者”退到”批量派发者+人工把关者”的角色。下文把它的核心机制、典型代表、选型差异和落地路径一次性拆开。
一、Background Agent 的核心机制
Background Agent 与传统 IDE 内 Copilot 的差别不在”能不能写代码”,而在”人和它的关系是不是同步”。它有四个共同特征:隔离的运行环境、可中断可恢复的任务、任务完成后的通知、合并前的人类把关。这四件事合在一起,才让”交办完走人”成为可能。
| 维度 | 传统 Copilot(前台) | Background Agent(后台) |
|---|---|---|
| 交互方式 | 人在编辑器里实时盯着 | 派完任务即可离开 |
| 执行环境 | 本地编辑器/IDE | 隔离沙箱、容器或独立 Git Worktree |
| 任务粒度 | 下一行/下一段 | 整张 issue、一段 prompt、一次重构 |
| 交付形式 | 候选代码片段 | 草稿 PR / diff / 终端日志 |
| 人类介入点 | 频繁打断、逐步确认 | 完成时一次审查,可设合并门禁 |
| 并行能力 | 受限于本机 | 多容器并行,吞吐取决于订阅档位 |
Cursor Background Agent 在自己的 VM 与分支跑、OpenAI Codex 在云端 microVM 跑、GitHub Copilot coding agent 跑在 GitHub Actions 的隔离 runner 上——各家实现细节不同,但”隔离执行+合并前人工 gate”这条原则一致。
二、为什么是 2025 年集中爆发
2025 年 2 月 Anthropic 发布 Claude Code 研究预览,5 月 OpenAI 推出云端 Codex、GitHub 发布 Copilot coding agent(项目代号 Padawan),6 月 Google 开源 Gemini CLI、Codex CLI 正式 GA,同年 Cursor 1.0 把 Background Agent 向全体用户开放。一年之内,五款主力工具全部就位,并不是偶然。
推动拐点的关键变量有三:
- 模型能力:SWE-bench Verified 头部模型的解决率从 2024 年初的约 50% 提升到 2025 下半年至 2026 年的 75% 至 80% 区间,模型已经具备独立完成多文件修改的能力;
- 云端算力:GitHub Actions 是 coding agent 的执行底座,2025 年 Octoverse 报告显示其免费 CI/CD 分钟数同比增长 35%;
- 协作惯性:2025 GitHub Octoverse 报告显示月均合并 PR 达 4320 万、同比增长 23%,Copilot coding agent 上线 5 个月即协助创建超 100 万次 PR,开发者已经习惯”AI 出活、我审 PR”。
这三件事叠加之后,Background Agent 才从”演示”变成”日常”。
三、主流工具的能力差异
同样叫 Background Agent,每家的能力边界、计费模型、并发上限差别巨大。2025-2026 年五款主流工具横向对比如下。
| 工具 | 触发方式 | 执行环境 | 异步能力 | 计费模型 |
|---|---|---|---|---|
| GitHub Copilot coding agent | 指派 GitHub Issue / @copilot | GitHub Actions 隔离 runner | PR 完成后通知 reviewer | 含于 Copilot 付费版,消耗 premium requests 与 Actions 分钟 |
| OpenAI Codex(云端) | ChatGPT 网页/手机 App | 隔离 microVM | 默认并行多任务,1~30 分钟 | 含于 ChatGPT 订阅,Plus 20 美元、Pro 200 美元 |
| Cursor Background Agent | IDE 内派活 | Cursor 自有 VM 与分支 | 本地工作区保持干净 | Pro 约 20 美元每月,云算力按 token |
| Claude Code 云端异步 | Web 界面 / & 后缀 | Anthropic 管理的隔离 VM | 支持会话穿梭、可定时 | 订阅 5 小时滚动窗口,API 按 token |
| Gemini CLI | 终端 | 本地或云端 | 60 次/分钟、1000 次/天 | 个人账号免费额度行业最大 |
能力维度上,多文件重构与自主跑测试五款都具备;PR 自我审查方面,Codex 内置 review agent、Cursor 有 Bugbot、Copilot coding agent 自带验证步骤;看截图理解需求的能力,Copilot coding agent 与 Codex 云端都已支持。生态文件上各家分别使用 CLAUDE.md、AGENTS.md、.instructions.md 等项目级指令文件来锚定代码规范。
四、典型工作流
Background Agent 落地的完整链路通常分四步:
- 准备项目级上下文:在仓库根目录放置 CLAUDE.md 或 AGENTS.md,写明技术栈、命令约定、禁改清单,作为所有后台任务的共享基线;
- 写清楚任务说明:像给同事写 brief 一样描述目标、验收标准、相关文件,避免模糊措辞;
- 派发并并行:把 issue 指派给 agent,或用
claude --background等命令推到云端,必要时多个任务并行; - 人工 gate:等 agent 提交草稿 PR 后做 code review,通过再合并,未通过打回并附反馈。
下面是一段在 Claude Code 中派发后台任务的最小化示例,前后分别是上下文文件与执行命令。
# 启动后台任务:把任务推到云端异步跑
claude --background --task "新增 GET /api/projects 接口,要求:
- 走 Prisma 查询当前用户的项目
- 用 Zod 做响应校验
- 补充一个 vitest 单元测试
- 遵循 app/api/tasks/route.ts 的现有写法"
<!-- CLAUDE.md:项目级背景,所有后台任务共享 -->
## Stack
- Next.js 15 (App Router) + TypeScript strict
- Prisma + PostgreSQL
- Vitest 单测,Playwright E2E
## Do NOT
- 不许装新依赖(除非显式说明)
- 改 prisma/schema.prisma 必须先问
- 跳过测试
效果上,任务被推到隔离环境后,开发者可以接着写别的模块或处理别的 issue;agent 完成会开 PR 并 @ reviewer,整条链路不需要本机一直开着。
五、选型与坑
选型上,三类场景的常见配置如下:
- 已用 GitHub 团队流程、要低侵入接入:选 GitHub Copilot(coding agent 走 Issue + Actions 流水线);
- 个人或小团队、要编辑器内并行与自动审 PR:选 Cursor(IDE 与 Background Agent 一体);
- 大仓库跨文件重构、终端工作流、愿为能力付费:选 Claude Code(订阅制 + 云端异步)。
容易踩的坑集中在三处:模糊的 issue 说明会让 agent 自信地写偏;让 agent 自行合并或部署会绕过 review gate;多个 agent 并行时未用 Git Worktree 隔离工作区会出现互相覆盖文件。Cursor 2025 年 7 月就修复过一起由 MCP 投毒引发的远程代码执行漏洞(CVE-2025-54135),第三方 MCP 服务器启用前必须审慎。
到这一步,Background Agent 的边界就清楚了:它把开发者从”逐行陪写”挪到”批量派发+合并把关”,吞吐量上来了,但任务的清晰度、隔离机制、合并门禁三件配套也必须跟上。
常见问题(FAQ)
Q1:Background Agent 和 Copilot 类自动补全是一回事吗?
不是。自动补全在编辑器里实时给候选、需人逐行确认;后台 Agent 在隔离环境里独立完成任务、最后交 PR。
Q2:派给后台 Agent 的任务该怎么写?
像给同事写 brief 一样写:目标、验收标准、相关文件、禁改清单都要写清,越模糊越容易跑偏。
Q3:可以让 Background Agent 自动合并 PR 吗?
不建议。合并、部署、发邮件等不可逆操作应保留在人类 review gate 之后,由人最终拍板。