議事録の整形も、営業提案の下書きも、経営判断の壁打ちも、全部いちばん賢いモデルにやらせる——AIを業務に組み込みはじめると、多くの会社がまずこの形になります。安心だし、迷わなくて済む。けれど会社の規模で続けると、AIの請求額は静かに膨らみ、その支払いが成果に見合っているかは、モデルの単価を見ているだけでは分かりません。本稿では、あるコーディング支援ツールのベンチマークを起点に、AIを「単価」ではなく「原価」で設計し直す考え方を整理します。
01なぜ「一番賢いモデルを全部に」が最適でなくなるのか
Cursorというプログラミング支援ツールが、「CursorBench」という評価結果を一般公開しています。2026年8月19日時点で公開されていた版(3.2)を見ると、経営の観点で見過ごせないことが起きていました。ほぼ同じスコアなのに、コストが数倍違うモデルが並んでいるのです。
CursorBench 3.2 / 2026-08-19 時点
スコア差は0.1ポイント、コストは約3.5倍。しかも同ページの首位は最安級の Grok 4.6 Extra High(70.8%/$2.81)で、ほぼ同点の Fable 5 Max は $17.32(約6倍)。「一番いいスコア=一番高いモデル」という関係が、そもそも成り立っていません。
Cursor公式の注意書き:“Results are subject to variance; small differences in scores may not be statistically meaningful.”(結果にはばらつきがあり、わずかなスコア差は統計的に意味を持たないことがある)
出典:Cursor「CursorBench」(3.2、2026年8月19日時点の公開値)
だから「70.0%と69.9%のどちらが賢いか」を競っても意味はありません。意味があるのは、“ほぼ同じ成果”を出せるモデルの間で、支払う金額がこれだけ広く分布している、という事実のほうです。同じモデルでも設定次第でコストは変わります。Opus 5 は Max設定だと $8.23、Low設定なら $2.55 で 62.8%。「どのモデルを」だけでなく「どの設定で」使うかでも、支払いは2倍以上動きます。
02ただし、これは「開発の」ベンチマークである
CursorBenchが評価しているのは、Cursorの実際の利用セッションから集めた「曖昧で、複数ファイルにまたがるコーディング課題」です(公式の説明による)。測っているのは、ソフトウェア開発の、それもCursorのユーザーがやるような仕事に対する性能です。
「CursorBenchで高得点だから、営業やマーケティングの仕事でも高性能だ」とは言えません。コードを書く能力と、顧客の課題を言語化する能力、経営会議の資料を的確に要約する能力は、別物です。加えてこのベンチマークはCursor社が自社で運用していて(同社は自社モデルのComposerも提供しています)、課題数や検証手順は公開されておらず、外部が同じ条件で再現できる形にはなっていません。数字は参考にはするけれど、鵜呑みにはできません。
これは結論ではなく、検証すべき仮説です。この仮説を業務設計に落とすときの出発点が、次の「3階層」です。
03eapのモデルルーティング設計 — 業務を3階層に分ける
私たちがAIを業務に組み込むとき、AIに任せる仕事を、重要度・曖昧さ・「間違えたときの損失」で3つの階層に分けます。そのうえで、階層ごとに充てるモデルの格を変える。これが「モデルルーティング」という設計です。
迷ったら失敗コストを優先します。形が決まった作業でも、誤ると顧客や金額に響くものは一段上の階層で扱います。
Level 1 で大事なのは最高品質ではなく、必要十分な精度を低コストで大量にさばくこと。Level 2 は、中位のモデルでも人が仕上げる前提なら十分に使える下書きが出てきます。Level 3 には迷わず高性能・高コストのモデルを充て、下位モデルが作ったものの最終レビューも任せます。
安いモデルで作り、高いモデルで判断する。全部を最上位でやるのでも、全部を最安でやるのでもなく、工程で使い分けます。Level 1 に一番高いモデルを充てるのは、軽トラで十分な荷物を高級車で運ぶようなものです。
AIの利用枠を、どの仕事に深く使うかという配分の視点は「ChatGPT・Codexの利用枠を、重要な仕事に残す。」でも整理しています。本稿の焦点は、その配分をお金、つまり原価で測ることです。
04本当に見るべきは「AI実質原価」
階層を分けると、次に効いてくるのがコストの見方です。AIのコストを、API利用料金だけで比べてはいけない——これが、実際に業務へ組み込んできての実感です。
説明のための例 安いモデルが1回10円で答えを出しても、人間が20分かけて直すなら、実際にはまったく安くない。逆に、高いモデルが1回300円でも、人の修正がほとんど要らずそのまま使えるなら、トータルでは安いこともある。単価の安さは、原価の安さではありません。
ここを混同して「安いモデルに寄せてコスト削減」とやると、見えない手直しコストが増え、結局トータルは変わらない、ということが起きます。
05eap BusinessBench — ビジネス業務でモデルを検証する
CursorBenchを眺めているだけでは答えは出ません。あれは開発の話で、御社の実際の業務の話ではないからです。そこで私たちが用意しているのが、ビジネス業務版のベンチマークという考え方です。仮に「eap BusinessBench」と呼んでいます。
同じ条件で複数のモデルに、実際のビジネス業務をやらせて比べます。議事録作成、TODO抽出、顧客メール作成、営業提案の骨子、競合分析、Webマーケの数値分析、経営会議資料の要約、KPIの異常検知、CRM分類、新規事業の評価、採用候補者の評価、顧客ヒアリングからの課題構造化まで——日々発生する業務を、そのまま課題にします。
この数字で並べ替えたとき、業務ごとに“勝つモデル”は変わります。そしてその並びは、おそらくCursorBenchの順位とは一致しません。単なるモデルランキングではなく、御社の業務に固有の最適配置が見えてくる。それが、このベンチマークの狙いです。
06始めるときの「最初の問い」5つ
自社のAI原価を最適化する前に、経営者・DX担当の方に問うていただきたい5つの問いです。私たちが初回の棚卸しで必ず確認している項目でもあります。
07次のテーマは「導入」ではなく「原価の最適化」
ここ数年、多くの会社にとってのテーマは「AIをどう導入するか」でした。そのフェーズは、もうすぐ終わります。次に来るのは、「導入したAIを、どの業務に、どのモデルで、いくらの原価で回すか」という話です。
言い換えると、AIにも原価管理が必要になってきた、ということです。工場が製品ごとに原価を見て材料と工程を最適化するのと同じことを、AIの業務についてもやることになる。一番賢いモデルを全部に使うのは、たしかに品質は出るけれど、経営として最適ではありません。
私たちは、この検証を実際のクライアント業務で進めています。どの業務にどのモデルを充てると、質を落とさずに原価が下がるのか。手直しゼロで使える割合は、どこまで上げられるのか。「可能性を、実現する力に変える」という私たちのパーパスは、AIの費用対効果を経営の言葉で設計し直すこの領域にも、そのまま当てはまります。
まず確認する3項目
- AIを使っている業務を書き出し、それぞれ使っているモデルを横に書く全業務が同じモデルなら、固定型になっている。
- その中から、Level 1 に当たる定型業務を一つ選ぶ1段安いモデルに替えて試す候補にする。
- その業務で、人が手直しした時間を一週間だけ記録する利用料と並べれば、実質原価の比較が始められる。
