生成AIとは何か — LLMの仕組みを最短で理解する
トークン、Transformer、コンテキストウィンドウ、温度、ハルシネーション。生成AIを使いこなすために最低限押さえておきたい仕組みをまとめる。
#生成AIの位置づけ
生成AI(Generative AI)は、テキスト・画像・音声・動画などの「新しいコンテンツ」を生成するAIの総称。その中でもテキストを扱う 大規模言語モデル(LLM: Large Language Model) が、ChatGPT や Claude、Gemini などの中核技術になっている。
| 種類 | 主な出力 | 代表例 |
|---|---|---|
| LLM | テキスト、コード | Claude、GPT、Gemini、Llama |
| 画像生成 | 画像 | Midjourney、Stable Diffusion、Imagen |
| 動画生成 | 動画 | Sora、Veo、Runway |
| 音声 | 音声合成・認識 | ElevenLabs、Whisper |
| マルチモーダル | 画像+テキストを入力 | 最近の主要LLMはほぼ対応 |
#LLMは「次のトークン」を予測している
LLMの本質は 「これまでの文脈に続く、最もそれらしい次のトークンを予測する」 こと。それを繰り返して文章を組み立てる。
- トークン: 文字列をモデルが処理する最小単位に分割したもの。英語では単語の断片、日本語では1〜2文字程度が1トークンになることが多い。
- 料金・コンテキスト上限・速度はすべてトークン数で決まるため、「何トークン使うか」の感覚を持つことが重要。
ヒント
日本語は英語よりトークン効率が悪い。同じ内容なら英語で書いた方がトークン数が少なくなることが多い。ただし出力品質は日本語のまま十分高いため、無理に英語化する必要はない。
#Transformer と Attention
現在のLLMはほぼすべて Transformer アーキテクチャに基づく。核となるのは Attention(注意機構) で、入力中のどのトークンがどのトークンと関係が深いかを計算し、文脈を捉える。
- 遠く離れた単語同士の関係も扱える
- 並列計算しやすいため巨大化しやすい
- 「パラメータ数」はモデルの規模を示す指標のひとつ(数十億〜数兆)
#コンテキストウィンドウ
一度にモデルへ渡せるトークン数の上限。入力と出力の合計 でカウントされる。
- 上限を超えた分は捨てられるか、エラーになる
- 長いほど資料を丸ごと渡せるが、コストと処理時間は増える
- 最近の主要モデルは 20万〜100万トークン級
メモ
会話型UIでは、過去のやりとりも毎回すべて送り直している(APIはステートレス)。長い会話ほど1ターンあたりのコストが上がる理由はここにある。
#温度(temperature)と確率的な出力
LLMの出力は確率的で、同じ入力でも毎回異なる可能性がある。
- temperature: 低いほど決定的(最も確率の高いトークンを選びやすい)、高いほど多様
- 事実確認・コード生成・分類は低め、アイデア出し・創作は高めが向く
- 最新モデルの一部ではサンプリングパラメータを受け付けず、代わりに「思考の深さ(effort)」で制御するものもある
#ハルシネーション(もっともらしい嘘)
LLMは「正しいこと」ではなく「それらしいこと」を生成する。存在しない論文、間違ったAPI名、架空の統計値を自信満々に出すことがある。
対策:
- 根拠を渡す: 資料・URL・コードを添付して「この情報だけを使って」と指示する(RAGの考え方)
- 検証させる: 「不明な場合は不明と言う」「出典を示す」を指示に含める
- 自分で確認する: 固有名詞・数値・日付は必ず一次情報で裏取り
- ツールを使わせる: Web検索やコード実行など、外部の事実にアクセスできる仕組みを併用する
#学習データとカットオフ
モデルには 知識のカットオフ日 がある。それ以降の出来事は知らないか、不正確。最新情報が必要な場合は検索ツールや資料の添付が必須。
#推論モデル(Reasoning)と思考
2025年以降のモデルは、回答前に「考える」プロセス(thinking / reasoning)を持つものが主流。難しい問題ほど思考時間を増やすと精度が上がるが、コストと遅延も増える。
- 簡単なタスクは思考を浅く、複雑なタスクは深く
- 「段階的に考えて」と指示するより、モデルの思考機能を使う方が効果的なことが多い
#まとめ
- LLMは次トークン予測器。文脈(プロンプト)がすべて
- トークン・コンテキストウィンドウ・温度の3つは常に意識する
- ハルシネーションは仕様。根拠を渡し、検証する運用で対処する