ChatGPTやGeminiの裏側で動く「LLM(大規模言語モデル)」。言葉は知っていても、仕組みや生成AIとの違いが分からないという方は多いはずです。本記事ではLLMの定義・動作原理・歴史を技術的に整理します。

この記事でわかること
・LLM(大規模言語モデル)の定義と特徴
・Transformerをベースにした動作原理(5ステップ)
・生成AIとの関係と代表モデルの歴史

Transformerモデルのアーキテクチャ図

出典:Wikimedia Commons

LLM(大規模言語モデル)とは

LLMとは「Large Language Model」の略です。インターネット上の膨大なテキストを学習し、単語の文脈パターンを習得した自然言語処理モデルです。計算量・データ量・パラメータ数を大規模に強化することで、翻訳・要約・コード生成・質問応答を一つのモデルで処理できます。

出典:富士通 LLMとは

LLMの仕組み——Transformer・トークン化・学習

LLMの中核は、2017年にGoogleが発表した「Attention Is All You Need」論文で提案されたTransformerです。動作は次の5ステップです。

出典:IBM LLMとは

ステップ処理内容
① トークン化テキストを単語・文字片に分割
② ベクトル化トークンを数値ベクトルに変換
③ 学習Transformerで単語間の関係を学習
④ 文脈理解前後の文脈でトークンの意味を調整
⑤ デコードベクトルをテキストに変換して出力

出典:NECソリューションイノベータ LLMとは

Transformerの自己注意機構(Self-Attention)は遠く離れた単語間の関係を一度に把握でき、長文の文脈理解に優れます。

生成AIとの違い——LLMは生成AIの「心臓部」

生成AIはテキスト・画像・音声など多様なコンテンツを生成するAI技術全般の総称です。LLMはその中でも自然言語処理に特化した一カテゴリに位置します。ChatGPTはLLMを中核エンジンとした生成AIサービスです。関連技術として、外部DBと組み合わせるRAGや特定業務向けのファインチューニングも実務で広く使われています。

出典:富士通 LLMとは

主要LLMモデルと歴史

年モデル開発元特徴
2018BERTGoogle双方向文脈理解を実現
2020GPT-3OpenAI1,750億パラメータで汎用タスク対応
2022LLaMAMetaオープンソース公開で研究を加速
2023GPT-4OpenAIマルチモーダル・高度推論を実現

出典:NECソリューションイノベータ LLMとは

GPT-3の1,750億パラメータはAI業界に衝撃を与え、スケールが性能を決めるという事実を実証しました。

出典:IBM LLMとは

まとめ
LLMはTransformerを基盤に大量テキストを学習した自然言語処理モデルで、生成AIの中核技術です。2017年のTransformer論文から2023年のGPT-4まで急速に進化し、RAGやファインチューニングと組み合わせることで実務での応用範囲が広がっています。