AI 代理把写代码的速度放大了好几倍,却没能让「判断代码对不对」这件事跟上。本文拆解一个被大多数人忽略的裂缝:代理在任务的尺度上做出一连串盲目的架构决定,漂移在复利中不断放大,三到四成的工程时间已花在返工上。解法不在更好的代理,而在代理之上的一层。
代码写得飞快,架构却在悄悄变差:当 AI 代理跑赢你的架构决策


AI 代理把写代码的速度放大了好几倍,却没能让「判断代码对不对」这件事跟上。本文拆解一个被大多数人忽略的裂缝:代理在任务的尺度上做出一连串盲目的架构决定,漂移在复利中不断放大,三到四成的工程时间已花在返工上。解法不在更好的代理,而在代理之上的一层。

OpenAI 工程师 Jeremy Lewi 用一套名为 Runme 的开源笔记本,把跑评估这类重复工作交给 Codex 执行,自己只负责审批和决策。本文拆解这套工作流的三个关键设计:持久的 goal、清晰的审批边界,以及让每一轮运行都沉淀成可复用上下文的飞轮机制。

恶意 Go 依赖在编译期写入一份假的 AGENTS.md,声称自己拥有「绝对权威」,成功让 Codex 把一次改动藏出代码审查。本文梳理 NVIDIA 红队、Prompt Security 和 GitInject 三条攻击路径,拆解这个开源指令格式为何天然是一条提示注入通道,以及安全边界到底该设在哪里。

有人把 Codex 的请求体逐字节截下来测量,发现一句 16 字符的「Reply with pong.」被包装成了 42980 字节、约 9435 个 token 的请求,真正的提示词只占 0.3%。其余全是工具定义、系统指令、技能元数据和环境上下文。本文拆解这个被多数人忽略的开销,以及它对隐私和成本意味着什么。

OpenAI 官方发文拆解 Codex 底层:真正支撑 App、CLI 和 IDE 的是同一个开源 harness。一个关键数据点说明执行循环的价值,GPT-5.6 Sol 在 ARC-AGI-3 上从 13.3% 提升到 38.3%,输出 token 却减少六倍。本文解读这个被多数人忽略的智能体引擎,以及它意味着什么。