本文へスキップ

LLM(大規模言語モデル)って何?

この記事は6で読めます

ざっくり言うと

LLM(大規模言語モデル)とは、大量の文章で学習して、言葉の仕事を幅広くこなせるようになったAIのことです。文章を書く、要約する、訳す、仕分けるといった作業を、まとめて引き受けます。

英語ではLarge Language Modelといい、その頭文字をとってLLMと呼ばれます。

ChatGPT・Claude・Gemini・Grokといったサービスは、このLLMを中心に置いて、検索や外部ツール、画像や音声の処理を組み合わせたものです。

ニュースで「生成AI」と紹介されている文章系のサービスは、その多くがLLMを土台にしています。まずは「文章を扱うために、うんと大きく訓練されたAI」と覚えておけば十分です

イメージ

LLMは、答えを1件ずつ保存して探す仕組みではありません。学習したパターンをもとに、その場で文章を組み立てています

ただし、学習に使った文章の一部を、そのまま覚えて出してしまうこともあります。同じことを聞いても、生成のときの条件しだいで言い回しが変わります。

「大規模」って、何が大きいの?

じつは、「大規模(Large)」に、全モデル共通の数値の線引きはありません。ここ、意外ですよね。

だいたい次の3つが、それまでの言語モデルより大きい、という意味で使われています。

  • 学習データの量
    本・Web・論文など、大量の文章を読み込ませる
  • モデルの規模
    中身の「調整つまみ」にあたるパラメータが多い
  • 計算量
    学習にも利用にも、大きな計算資源を使うことがある

規模も、公開されている情報も、モデルによってまちまちです。そして、パラメータが多いほど賢い、というわけでもありません。使った学習データ、学習のやり方、モデルの設計、あとから加える調整でも、仕上がりは変わります。

つまりLLMとは、言語モデルをうんと大きな規模で訓練して、いろいろな文章の仕事に使えるようにしたものです。

正確には

IBMの解説では、LLMは大量のデータで訓練され、自然言語やそのほかの内容を扱う深層学習モデルだと説明されています。深層学習というのは、AIという大きなくくりの中の機械学習、そのまた中にある学習のやり方です。

ふだん使われているLLMの多くは、この深層学習を使ったモデルにあたります。そのなかでも、言葉を中心に扱う大きなモデルがLLMです。

いま主流になっている設計は、2017年にGoogleの研究者らが発表したTransformerです。

ただし、「LLMはすべてTransformerでできている」とまでは言えません。IBMの解説にも、Mambaのような状態空間モデルや拡散型の言語モデルなど、Transformerとは違う設計が研究・開発されていると書かれています。

LLMの主な特徴

特徴を5つの観点で並べると、こうなります。

観点どういうこと?
学習データ書籍・Web・コードなど、大量の文章を前もって読み込ませる
モデルの規模パラメータ・データ・計算量が大きい(共通の数値基準はない)
得意なこと文章生成・要約・翻訳・分類・質問応答・コード生成など、言葉まわり全般
汎用性1つのモデルをいろいろな用途に使える(専用モデルを毎回作らなくていい)
中身の仕組みTransformerが主流。ほかの設計も開発されている

「翻訳専用」だった時代から、何が変わったのか

それまでの言語AIは、「翻訳専用」「分類専用」というように、用途ごとに別々のモデルを作るのが普通でした。LLMが出てきて変わったのは、大きく次の2つです。

  • 長い文脈を使えるようになった
    入力された会話や文書を手がかりにして、続きや答えを作れる
  • 何役もこなせるようになった
    要約も翻訳も相談も下書きも、1つのモデルに頼める

一度に手がかりにできる量はコンテキストウィンドウと呼ばれ、モデルごとに違います。これは、学習に使った文章の総量とは別の話です。

使う場面

ChatGPT・Claude・Gemini・Grokとの関係

サービス名とモデル名は、同じとは限りません。ここを分けて覚えておくと、新しいモデルや機能が出てきたときにも、話を整理しやすくなります。

注意点

やってみよう

ここまでで、「LLMは、文章を大量に学習した大きな言語モデル」「ChatGPTたちは、そのLLMを使ったサービス」の2つがつかめれば十分です。次の記事では、そのLLMがどうやって次の言葉を選んでいるのか、もう一歩だけ中身をのぞいてみます。

よくある質問

Q. LLMの「大規模」とは、何が大きいのですか?
A. 学習に読み込ませる文章の量、中身の調整つまみにあたるパラメータの数、そして計算量です。全モデル共通の数値の線引きはなく、パラメータが多いほど賢いというわけでもありません。
Q. LLMは、どんな仕事が得意なのですか?
A. 文章生成・要約・翻訳・分類・質問応答・コード生成など、言葉まわり全般です。用途ごとに専用モデルを作らなくても、1つのモデルにいろいろ頼めるようになりました。
Q. LLMが一度に読み取れる量は、学習した文章の量で決まるのですか?
A. 別の話です。一度に手がかりにできる量はコンテキストウィンドウと呼ばれ、モデルごとに違います。学習に使った文章の総量とは分けて考えてください。
Q. 自分が使っているAIの中身は、どこで確かめられますか?
A. 画面でサービス名と、いま選ばれているモデル名を確認してください。あわせて、Web検索やファイルの読み取りなどモデル以外の機能が使える状態かどうかも見ておくと、答えの出どころが分かります。

公開: 更新: ✓ 公式情報と照合:

参考ソース

判断クイズ

ふだん使っているAIサービスの正体を、ひとことで言えますか?

3問です。答えるとその場で解説が出ます。全問終えたら、「回答を記録する」で学習の記録に残せます。

1. 2つのAIを比べて「こちらのほうがパラメータが多いので賢いです」と言われました
2. 社内で「ChatGPTというLLMを導入します」と説明されました
3. 補助金の申請期限をLLMに聞いたら、自信ありげな文章で日付が返ってきました

全問に答えると、回答を記録できます。

残るのは「答えたかどうか」だけで、正解数は保存されません。この端末の中だけに残り、別の端末には引き継がれません。

この教科書は無料で全文公開しています。仕事で使えるところまで進みたい方は、実習と資料がそろった生徒プランをどうぞ。

生徒プランを見る(14日間無料)

あわせて読みたい