Claude Code / Codex / Pi 在同一模型上正确率差 1 个点,账单却差一倍。Pi 四个工具能打到帕累托前沿!
Berkeley 拿同一批模型,分别塞进 3 个外壳测:Claude Code、Codex、Pi
通俗对比:
🔹同一道题、同一个模型
Claude Code:对了 97.8%,花 $1.33
Pi:对了 96.7%,花 $0.67
多对 1 道题的零头,却多花一倍钱🔹整体账单
Claude Code 大约是 Pi 的 2 倍,是 Codex 的 1.6 倍
Terminal 那组测试里,Claude Code 大约是 Pi 的 1.5 倍🔹还有更夸张的
GPT-5.6 Sol 换到 Pi 上:分数更高,钱只要 Codex 的一半🔹钱多花在哪了
两边跑的轮数几乎一样,但 Claude Code 一开口,塞给模型的说明就比 Pi 多 10 倍,等于每聊一轮,都先交一笔“外壳税”一句话:
模型是发动机,外壳是车身。车身太厚,油耗先上去,速度不一定更快。
原生外壳也不一定最配。有的模型在 Pi 里更香,有的在 Codex 里更好。
选模型时,把外壳一起比!
主楼本质还是harness的区别
《写一套完善的harness的重要性》--Pi