主要LLMの比較と使い分けの基準
Claude / GPT / Gemini / オープンウェイトモデルを、用途・コスト・コンテキスト長・エコシステムの観点で比較し、自分なりの選定基準をまとめる。
#選定の観点
モデル選びで見るべき軸は5つ。
- タスク適性: コーディング、長文読解、日本語、創作、推論、画像理解
- コスト: 入力/出力トークン単価、キャッシュ割引、バッチ割引
- コンテキスト長: 一度に渡せる量(20万〜100万トークン)
- 速度・レイテンシ: チャットUIかバックエンド処理か
- エコシステム: API、ツール利用、SDK、サードパーティ対応、データ取り扱い
重要
ベンチマークの数値差より「自分の実タスクで試した結果」を優先する。同じプロンプトを2〜3モデルに投げて比較する習慣をつける。
#主要ファミリーの特徴(2026年時点の所感)
| ファミリー | 強み | 向く用途 |
|---|---|---|
| Claude(Anthropic) | 長文理解、コーディング、エージェント的タスク、指示追従の安定性 | Claude Code、ドキュメント処理、複雑な業務自動化 |
| GPT(OpenAI) | 幅広いツール・サービス連携、マルチモーダル、エコシステムの広さ | 汎用チャット、画像・音声を絡めたアプリ |
| Gemini(Google) | 超長コンテキスト、Google Workspace/検索との統合、動画理解 | 大量資料の一括処理、Google環境での活用 |
| オープンウェイト(Llama、Qwen、Mistral 等) | ローカル実行、カスタマイズ、データを外に出さない | オンプレ、ファインチューニング、コスト最適化 |
#Claude ファミリーの階層
Anthropic のモデルは能力とコストの階層になっている。
- Fable / Mythos: 最上位。最も難しい推論・長時間のエージェント作業向け
- Opus: 高性能。コーディングや複雑な分析の主力
- Sonnet: バランス型。多くの実務タスクの標準
- Haiku: 高速・低コスト。分類、抽出、サブタスク向け
実務では「Sonnet で始めて、精度が足りなければ Opus、大量処理は Haiku」という使い分けが基本。
#用途別の私の使い分け
| 用途 | 第一候補 | 理由 |
|---|---|---|
| コーディング(エージェント) | Claude(Claude Code) | 大規模リポジトリの理解と修正の安定性 |
| 長文資料の要約・QA | Claude / Gemini | コンテキスト長と読解精度 |
| 大量の分類・抽出 | Haiku 級の軽量モデル | コストと速度 |
| ブレスト・壁打ち | 手元で一番速いモデル | 往復回数が多いため速度重視 |
| 機密データの処理 | オープンウェイト(ローカル) | データを外部に出さない |
#コストを見るときの注意
- 出力トークンは入力の5倍前後高い のが一般的。長い出力を求めるほど高くつく
- プロンプトキャッシュ: 同じ前置き(システムプロンプト、資料)を繰り返し送る場合、キャッシュ読み取りで最大90%程度安くなる
- バッチAPI: 即時性が不要な処理は半額になることが多い
- 「思考」機能はトークンを消費する。簡単なタスクでは effort を下げる
#切り替えコストを下げる設計
特定モデルにロックインしないために:
- プロンプトはモデル固有の癖に依存しすぎない
- モデル名は設定値として外に出す
- 評価セット(数十件の入出力例)を持っておき、乗り換え時に回帰チェックする
#まとめ
- 5つの軸(適性・コスト・コンテキスト・速度・エコシステム)で判断
- Sonnet 級を標準、難しければ上位、大量なら下位
- 実タスクでの比較と評価セットの整備が最良の選定手段