主要LLMの比較と使い分けの基準

Claude / GPT / Gemini / オープンウェイトモデルを、用途・コスト・コンテキスト長・エコシステムの観点で比較し、自分なりの選定基準をまとめる。

#選定の観点

モデル選びで見るべき軸は5つ。

  1. タスク適性: コーディング、長文読解、日本語、創作、推論、画像理解
  2. コスト: 入力/出力トークン単価、キャッシュ割引、バッチ割引
  3. コンテキスト長: 一度に渡せる量(20万〜100万トークン)
  4. 速度・レイテンシ: チャットUIかバックエンド処理か
  5. エコシステム: API、ツール利用、SDK、サードパーティ対応、データ取り扱い

重要

ベンチマークの数値差より「自分の実タスクで試した結果」を優先する。同じプロンプトを2〜3モデルに投げて比較する習慣をつける。

#主要ファミリーの特徴(2026年時点の所感)

ファミリー強み向く用途
Claude(Anthropic)長文理解、コーディング、エージェント的タスク、指示追従の安定性Claude Code、ドキュメント処理、複雑な業務自動化
GPT(OpenAI)幅広いツール・サービス連携、マルチモーダル、エコシステムの広さ汎用チャット、画像・音声を絡めたアプリ
Gemini(Google)超長コンテキスト、Google Workspace/検索との統合、動画理解大量資料の一括処理、Google環境での活用
オープンウェイト(Llama、Qwen、Mistral 等)ローカル実行、カスタマイズ、データを外に出さないオンプレ、ファインチューニング、コスト最適化

#Claude ファミリーの階層

Anthropic のモデルは能力とコストの階層になっている。

  • Fable / Mythos: 最上位。最も難しい推論・長時間のエージェント作業向け
  • Opus: 高性能。コーディングや複雑な分析の主力
  • Sonnet: バランス型。多くの実務タスクの標準
  • Haiku: 高速・低コスト。分類、抽出、サブタスク向け

実務では「Sonnet で始めて、精度が足りなければ Opus、大量処理は Haiku」という使い分けが基本。

#用途別の私の使い分け

用途第一候補理由
コーディング(エージェント)Claude(Claude Code)大規模リポジトリの理解と修正の安定性
長文資料の要約・QAClaude / Geminiコンテキスト長と読解精度
大量の分類・抽出Haiku 級の軽量モデルコストと速度
ブレスト・壁打ち手元で一番速いモデル往復回数が多いため速度重視
機密データの処理オープンウェイト(ローカル)データを外部に出さない

#コストを見るときの注意

  • 出力トークンは入力の5倍前後高い のが一般的。長い出力を求めるほど高くつく
  • プロンプトキャッシュ: 同じ前置き(システムプロンプト、資料)を繰り返し送る場合、キャッシュ読み取りで最大90%程度安くなる
  • バッチAPI: 即時性が不要な処理は半額になることが多い
  • 「思考」機能はトークンを消費する。簡単なタスクでは effort を下げる

#切り替えコストを下げる設計

特定モデルにロックインしないために:

  • プロンプトはモデル固有の癖に依存しすぎない
  • モデル名は設定値として外に出す
  • 評価セット(数十件の入出力例)を持っておき、乗り換え時に回帰チェックする

#まとめ

  • 5つの軸(適性・コスト・コンテキスト・速度・エコシステム)で判断
  • Sonnet 級を標準、難しければ上位、大量なら下位
  • 実タスクでの比較と評価セットの整備が最良の選定手段