先说结论
把一个任务交给终端里的编码代理自己跑:两个都能干,但风格不同。基于公开资料和我们的小样本实测(实测数据位见下文【待补】,方法公开,欢迎复核):要长链路自主执行、大型仓库重构、把代理塞进自己的终端工作流,Claude Code 目前更对味;要开源 CLI 本体、云端异步跑任务、手头已有 ChatGPT 订阅,Codex 上手更顺。两家都是”订阅或 API”双轨计费,切换的真实成本在记忆文件和操作习惯,不在钱。

为什么把这两个放在一起比
因为它们是同一类工具:都是”给任务、自己干”的终端编码代理——读仓库、改文件、跑命令、交结果,不是行级补全。拿它们对比,才有可比性。
两边的基本盘:Claude Code 是 Anthropic 官方 CLI,npm 包 @anthropic-ai/claude-code,需要 Node.js 18+,闭源分发;Codex 是 OpenAI 的编码代理产品线,CLI 在 GitHub 开源(openai/codex 仓库,Rust 编写,Apache-2.0 许可),另有 IDE 扩展、ChatGPT 里的云端任务和 GitHub 代码评审入口。
计费结构同构:Claude Code 走 Claude 订阅(Pro / Max)或 Anthropic API key;Codex 走 ChatGPT 订阅(Plus / Pro 等)或 OpenAI API key(当前价格【待补:双方定价页】)。模型背景:Claude Code 的主力是 Sonnet 系列,Sonnet 4.5 一代起就是主力之一(当前默认【待补】),公开规格 20 万 token 上下文窗口;Codex 的模型线从 codex-1 到 GPT-5-Codex 一类编码特调版本(当前默认【待补】)。
实测环境
| 项目 | 内容 |
|---|---|
| 测试机 | 【待补:机型 / CPU / 内存 / 系统版本】 |
| 网络环境 | 【待补:地区与代理情况】 |
| Claude Code 版本 | 【待补:claude —version 输出】 |
| Codex CLI 版本 | 【待补:codex —version 输出】 |
| 仓库与任务集 | 【待补:几个仓库、几类任务(修 bug / 新功能 / 重构 / 写测试)、每类几题】 |
| 评分口径 | 【待补:一次通过 / 多轮返工后通过 / 失败;计时与 token 记账方式】 |
| 计费方式 | 【待补:双方各用订阅额度还是 API 计费】 |
对比总表
| 维度 | Claude Code | Codex |
|---|---|---|
| 出品方 | Anthropic | OpenAI |
| CLI 开源 | 否(官方 npm 分发) | 是(GitHub 开源,Apache-2.0,Rust) |
| 安装 | npm(@anthropic-ai/claude-code),Node.js 18+ | npm(@openai/codex)或 Homebrew,Rust 单二进制 |
| 登录与计费 | Claude 订阅或 Anthropic API key;企业可切 Bedrock / Vertex 后端 | ChatGPT 订阅登录或 OpenAI API key |
| 权限与沙箱 | 权限模式:default / plan / acceptEdits / bypassPermissions,可配 hooks 拦截 | 沙箱三档:read-only / workspace-write / danger-full-access,另配审批策略 |
| 项目记忆 | CLAUDE.md,支持 @ 路径拆分引用 | AGENTS.md,已成跨工具通用约定 |
| 扩展机制 | MCP、子代理、hooks、skills | MCP(config.toml 配置)、云端任务 |
| 云端与异步 | 网页形态曾以预览推出(当前状态【待补】) | ChatGPT 内云端任务、GitHub 代码评审 |
| 实测:任务完成率 | 【待补:实测数据】 | 【待补:实测数据】 |
| 实测:平均耗时与 token 成本 | 【待补:实测数据】 | 【待补:实测数据】 |
逐项分析
安装与登录
两个都是一行命令装完。Claude Code 首次运行引导你选订阅登录或 API key;Codex 用 ChatGPT 账号登录即可——这里有个隐性差异:很多人的 ChatGPT 订阅已经在那儿了,用 Codex 不新增支出;反之,Claude 订阅用户装 Claude Code 也是零边际成本。先盘一眼自己已有的订阅,能省一轮决策。
权限与沙箱:谁来兜住代理的误操作
Codex 默认沙箱执行,档位写在明面上:read-only 只读、workspace-write 限工作区、danger-full-access 全放开,再叠加审批策略控制何时询问。Claude Code 用的是另一套组合拳:权限模式逐操作放行,plan 模式先出计划不动手,hooks 可以在工具调用前后插入自动检查。工程偏好上:想要”默认关笼子、边界清晰”选 Codex 的沙箱语义;想要”细粒度审批流加可编程钩子”选 Claude Code 的权限体系。两边都不建议在真实仓库里裸奔全权限。
项目记忆与规则文件
Claude Code 读 CLAUDE.md,支持用 @ 路径把规则拆成多个文件引用,大仓库能按目录分层维护。Codex 读 AGENTS.md——后者正在被多家编码工具采纳,几乎要成为行业默认约定,写一份 AGENTS.md 在多个工具间都能吃。实操建议两边通用:把构建命令、测试命令、代码规范写进去,代理质量立刻上一个台阶;不写,它每轮都在猜。
生态与扩展
双方都支持 MCP(Model Context Protocol,Anthropic 发起、OpenAI 与 Google 等相继跟进的开放协议),数据库、浏览器、issue 系统的接入方法可以互相迁移。Claude Code 多出子代理、hooks、skills 这些工程化零件,适合搭个人自动化流水线;Codex 的云端任务适合把不阻塞的活扔到后台跑,回头收 PR。扩展路径的分岔其实是产品哲学的分岔:一个往你的终端里钻,一个往云上飘。
成本结构
双轨计费下,低门槛都存在:订阅固定月费换额度窗口,API 按量适合脉冲式使用。具体数字【待补:双方定价页】,测算方法见性价比测算篇。结构性差异在沙箱外的部分:Codex 的云端任务烧的是订阅额度但省你的挂机时间;Claude Code 的 CI 用法建议走 API key 并设预算上限,账目更干净。
实测结果(核心数据位)
同一任务集下的完成率、平均轮次、耗时、token 成本:【待补:完整实测数据表】。先把方法放在这里:同仓库、同提示词、同评分口径,两个工具各跑同样数量的任务,记录一次通过率与返工次数,token 成本用 /cost 与双方后台账单核对。数据出来之前,别信任何”谁吊打谁”的结论,包括本文先说结论那一节——那里只对定性差异负责。
最终推荐
- 重度终端党、大型重构专项、要搭自动化流水线:先试 Claude Code,权限体系与工程化零件更全。
- ChatGPT 订阅在手、想要云端异步与开源 CLI:先试 Codex,边际成本接近零。
- 想改工具本体、要审计实现:只有 Codex 开源给你看,Apache-2.0 许可随便研究。
- 企业要求模型调用走自有云账号:Claude Code 有 Bedrock / Vertex 现成开关。
- 拿不定主意:两个都装,一周内各跑三个真实任务,比读十篇对比文都管用——包括这篇。