生成AIとは何か — LLMの仕組みを最短で理解する

トークン、Transformer、コンテキストウィンドウ、温度、ハルシネーション。生成AIを使いこなすために最低限押さえておきたい仕組みをまとめる。

#生成AIの位置づけ

生成AI(Generative AI)は、テキスト・画像・音声・動画などの「新しいコンテンツ」を生成するAIの総称。その中でもテキストを扱う 大規模言語モデル(LLM: Large Language Model) が、ChatGPT や Claude、Gemini などの中核技術になっている。

種類主な出力代表例
LLMテキスト、コードClaude、GPT、Gemini、Llama
画像生成画像Midjourney、Stable Diffusion、Imagen
動画生成動画Sora、Veo、Runway
音声音声合成・認識ElevenLabs、Whisper
マルチモーダル画像+テキストを入力最近の主要LLMはほぼ対応

#LLMは「次のトークン」を予測している

LLMの本質は 「これまでの文脈に続く、最もそれらしい次のトークンを予測する」 こと。それを繰り返して文章を組み立てる。

  • トークン: 文字列をモデルが処理する最小単位に分割したもの。英語では単語の断片、日本語では1〜2文字程度が1トークンになることが多い。
  • 料金・コンテキスト上限・速度はすべてトークン数で決まるため、「何トークン使うか」の感覚を持つことが重要。

ヒント

日本語は英語よりトークン効率が悪い。同じ内容なら英語で書いた方がトークン数が少なくなることが多い。ただし出力品質は日本語のまま十分高いため、無理に英語化する必要はない。

#Transformer と Attention

現在のLLMはほぼすべて Transformer アーキテクチャに基づく。核となるのは Attention(注意機構) で、入力中のどのトークンがどのトークンと関係が深いかを計算し、文脈を捉える。

  • 遠く離れた単語同士の関係も扱える
  • 並列計算しやすいため巨大化しやすい
  • 「パラメータ数」はモデルの規模を示す指標のひとつ(数十億〜数兆)

#コンテキストウィンドウ

一度にモデルへ渡せるトークン数の上限。入力と出力の合計 でカウントされる。

  • 上限を超えた分は捨てられるか、エラーになる
  • 長いほど資料を丸ごと渡せるが、コストと処理時間は増える
  • 最近の主要モデルは 20万〜100万トークン級

メモ

会話型UIでは、過去のやりとりも毎回すべて送り直している(APIはステートレス)。長い会話ほど1ターンあたりのコストが上がる理由はここにある。

#温度(temperature)と確率的な出力

LLMの出力は確率的で、同じ入力でも毎回異なる可能性がある。

  • temperature: 低いほど決定的(最も確率の高いトークンを選びやすい)、高いほど多様
  • 事実確認・コード生成・分類は低め、アイデア出し・創作は高めが向く
  • 最新モデルの一部ではサンプリングパラメータを受け付けず、代わりに「思考の深さ(effort)」で制御するものもある

#ハルシネーション(もっともらしい嘘)

LLMは「正しいこと」ではなく「それらしいこと」を生成する。存在しない論文、間違ったAPI名、架空の統計値を自信満々に出すことがある。

対策:

  1. 根拠を渡す: 資料・URL・コードを添付して「この情報だけを使って」と指示する(RAGの考え方)
  2. 検証させる: 「不明な場合は不明と言う」「出典を示す」を指示に含める
  3. 自分で確認する: 固有名詞・数値・日付は必ず一次情報で裏取り
  4. ツールを使わせる: Web検索やコード実行など、外部の事実にアクセスできる仕組みを併用する

#学習データとカットオフ

モデルには 知識のカットオフ日 がある。それ以降の出来事は知らないか、不正確。最新情報が必要な場合は検索ツールや資料の添付が必須。

#推論モデル(Reasoning)と思考

2025年以降のモデルは、回答前に「考える」プロセス(thinking / reasoning)を持つものが主流。難しい問題ほど思考時間を増やすと精度が上がるが、コストと遅延も増える。

  • 簡単なタスクは思考を浅く、複雑なタスクは深く
  • 「段階的に考えて」と指示するより、モデルの思考機能を使う方が効果的なことが多い

#まとめ

  • LLMは次トークン予測器。文脈(プロンプト)がすべて
  • トークン・コンテキストウィンドウ・温度の3つは常に意識する
  • ハルシネーションは仕様。根拠を渡し、検証する運用で対処する