【PR】この記事には楽天アフィリエイト・Amazonアソシエイト・A8.netの広告リンクが含まれます。商品やサービスは公式の仕様・条件と販売情報を確認して選んでおり、実機テストによる評価ではありません。 Amazonのアソシエイトとして、PROBEFOLIOは適格販売により収入を得ています。

AIのニュースでは「80億パラメータ」「700億パラメータ」のような数字がよく出てきます。パラメータ数は、AIの中にある、学習で決まる数字の個数のことで、モデルの大きさを表す目安です。

この記事では、2026年9月25日に確認した各社の公式発表と論文をもとに、パラメータ数の意味と、ニュースの数字の正しい読み方を説明します。

この記事の目次
01

結論:学習で決まる数字の個数。多いほど表現力は上がるが、それだけで賢さは決まらない

パラメータは、AI(ニューラルネットワーク)の中にある、学習で値が決まる数字のことです。主に、重みとバイアスを指します。パラメータ数は、その個数です。

一般に、パラメータ数が多いほど、複雑な関係を学べる余地が大きくなります。ただし、学習に使ったデータの量や質、学習の方法でも性能は大きく変わるので、パラメータ数だけで賢さは決まりません。

よく出てくる言葉は、表「パラメータ数の読み方」のとおりです。

パラメータ数の読み方
言葉意味例
パラメータ学習で値が決まる数字(重み・バイアス)迷惑メールの判定の例では4個
B(billion)10億8B=80億、70B=700億
総パラメータ数モデル全体のパラメータの数gpt-oss-120bは約1,170億
アクティブなパラメータ数1つの言葉を処理するときに実際に使う数gpt-oss-120bは約51億
02

パラメータとは:迷惑メールの判定の例で4個

ニューラルネットワークをわかりやすくで使った迷惑メールの判定の例では、3つの手がかりの重み(3・4・1)と、基準のバイアス(−5)の、合わせて4個のパラメータがありました。

学習とは、これらの数字を、たくさんの例で間違いが少なくなるように直していくことです。学習が終わった後のパラメータの値に、AIが学んだことが詰まっています。

大規模言語モデルは、同じような数字を数十億から数千億個持っています。技術評論社の『大規模言語モデル入門』も、大規模言語モデルを「大規模なパラメータで構成されるニューラルネットワーク」と説明しています。

03

「B」の読み方:8Bは80億、70Bは700億

パラメータ数は、英語のbillion(10億)の頭文字を取って「B」で書かれることが多くあります。8Bなら80億、70Bなら700億、405Bなら4,050億です。

1兆を超えると、trillion(1兆)の「T」で書かれることもあります。日本語のニュースでは「700億パラメータ」のように、日本語の単位に直して書かれることもあります。

モデルの名前に数字が入っている場合、多くはパラメータ数を表しています。ただし、名前の数字と正確な数が少し違うこともあるので、公式の資料で確かめてください。

04

公開されている主なモデルの数字

重み(パラメータの値)を公開しているモデルの多くは、パラメータ数も公式に公表しています。2026年9月25日に公式の発表や論文で確かめた数字は、表「公式に公開されているパラメータ数」のとおりです。

OpenAIのgpt-oss-120bの名前は「120b」ですが、公式の総パラメータ数は117bです。名前の数字は目安で、正確な数は公式の表で確かめる必要があることが分かります。

公式に公開されているパラメータ数(2026年9月25日確認)
モデル(発表)総パラメータ数1つの言葉あたりに使う数
Llama 3.1(Meta、2024年7月)8B・70B・405B総数と同じ(MoEではない作り)
gpt-oss-20b(OpenAI、2025年8月)21B3.6B
gpt-oss-120b(OpenAI、2025年8月)117B5.1B
DeepSeek-V3(2024年12月)671B37B
05

最新の主力モデルの多くは、パラメータ数を公表していない

ChatGPTなどで使われる最新の主力モデルは、パラメータ数を公表していないことが多くあります。OpenAIはGPT-4の技術報告で、競争の状況と安全性を理由に、モデルの大きさを含む設計の詳細を載せないと書いています。

2026年9月22日のGPT-6 Sol・Lunaの発表でも、性能や料金は示されていますが、パラメータ数は書かれていません。

そのため、非公開のモデルの数字をニュースやブログで見かけたら、公式の数字か、推定の数字かを必ず確かめてください。

06

噂の数字に注意する

非公開のモデルほど、根拠のはっきりしない数字が出回りやすくなります。検索の上位の記事の中には、GPT-4のパラメータ数を「100兆」と書いているものもありますが、OpenAIはGPT-4の大きさを公表していません。

推定の数字を扱うときは、誰が、どんな方法で推定したのかが書かれているかを見ます。書かれていなければ、その数字を判断の材料にしないほうが安全です。

比べるときは、公式に公開された数字だけで比べるか、推定の数字には「推定」とはっきり書いて区別します。

07

多いほど賢いのか:大きさ以外で決まる部分も大きい

一般に、同じ作り方なら、パラメータ数が多いほど性能が上がる傾向があります。『大規模言語モデル入門』の目次にも、「モデルの大規模化とその効果」という節があります。

ただし、作り方が違えば話は変わります。OpenAIは、gpt-oss-120b(総パラメータ117B)が、中心的な推論のテストで自社のo4-miniとほぼ同じ結果になったと説明しています。

学習に使ったデータの量と質、学習の後の調整、考える量の設定などで、同じくらいの大きさでも性能は大きく変わります。パラメータ数は「大きさ」の目安で、「賢さ」の点数ではないと考えてください。

08

総パラメータとアクティブなパラメータ:MoEという作り方

最近のモデルには、たくさんの「専門家」の部分を持ち、言葉ごとにその一部だけを使うMoE(mixture-of-experts)という作り方があります。

OpenAIのgpt-oss-120bは、総パラメータが117Bですが、1つの言葉を処理するときに使うのは5.1Bです。DeepSeek-V3も、総パラメータ671Bのうち、1つの言葉あたり37Bを使います。

使う数が少ないので、総パラメータ数のわりに計算が軽くなります。ニュースでパラメータ数を見るときは、総数なのか、実際に使う数なのかも確かめてください。

09

動かすのに必要なメモリを計算する

モデルを動かすには、パラメータの値をすべてメモリに読み込む必要があります。必要なメモリの目安は、「パラメータ数 × 1個あたりのバイト数」で計算できます。

1個の数字を16ビット(2バイト)で持つなら、8Bのモデルで約16GB、70Bのモデルで約140GBです。4ビット(0.5バイト)まで粗くすれば、8Bで約4GB、70Bで約35GBになります。

これは重みだけの目安で、実際には、会話の長さなどに応じてさらにメモリを使います。計算した数字より余裕のあるメモリを用意するのが安全です。

重みを読み込むのに必要なメモリの目安
パラメータ数16ビット(2バイト)4ビット(0.5バイト)
8B(80億)約16GB約4GB
21B(210億)約42GB約10.5GB
70B(700億)約140GB約35GB
405B(4,050億)約810GB約203GB
10

量子化:数字を粗くしてメモリを減らす

1個の数字をより少ないビットで持つように粗くすることを、量子化と呼びます。16ビットを4ビットにすれば、必要なメモリはおよそ4分の1になります。

OpenAIは、gpt-oss-20bがわずか16GBのメモリの機器で動き、gpt-oss-120bが80GBのGPU 1枚で効率よく動くと説明しています。総パラメータの数だけから計算するより、ずっと少ないメモリで動く作りになっています。

粗くしすぎると、答えの質が落ちることがあります。どこまで粗くするかは、用途と、手元の機器のメモリで決めます。

11

自分のPCで動かすなら:GPUのメモリが目安

重みを公開しているモデルは、自分のPCで動かすこともできます。速く動かすには、GPU(画像処理の部品)のメモリに、モデルの重みが収まることが大きな目安になります。

表「重みを読み込むのに必要なメモリの目安」を見ると、8Bのモデルを4ビットで動かすなら数GB、21Bなら10GBほどが必要です。GPUのメモリが足りない場合は、PCのメインのメモリとCPUで動かす方法もありますが、遅くなります。

GPUを使わない場合の試し方は、ローカルLLMはGPUなしで使える?CPUだけで日本語3課題を試した結果で説明しています。

12

パラメータ数と、料金・速さの関係

一般に、パラメータ数が多く、1つの言葉あたりに使う数が多いほど、計算が重くなり、答えが出るまでの時間と費用が増えます。

APIの料金は、多くの場合、モデルの大きさではなく、読み込ませた量と書かせた量(トークン)で決まります。たとえば2026年9月22日の発表では、GPT-6 Solの料金はLunaの20倍でした。OpenAIは両方の大きさを公表していません。

つまり、料金の差は、大きさや計算の重さの違いを反映していると考えられますが、公開されていない以上、料金からパラメータ数を逆算することはできません。

13

大きくなってきた流れと、学習データの量

LoRAの論文は、2020年のGPT-3を1,750億パラメータのモデルとして扱っています。その後、公開されたモデルでも、Llama 3.1の405Bや、DeepSeek-V3の671Bのように、さらに大きなものが出てきました。

大きさと一緒に、学習に使う文章の量も増えています。MetaはLlama 3.1 405Bを15兆トークンを超える文章で、DeepSeek-V3は14.8兆トークンで学習したと説明しています。

大きなモデルほど、たくさんのデータと計算が必要です。パラメータ数は、モデルを作るための費用の大きさを表す数字でもあります。

14

小さなモデルの使いどころ

パラメータ数が小さいモデルにも、はっきりした使いどころがあります。必要なメモリが少なく、答えが速く、動かす費用も安く済むことです。

OpenAIが16GBのメモリの機器で動くと説明しているgpt-oss-20bのように、手元のPCやスマホに近い機器で動かせるモデルなら、データを外に送らずに使えます。

文章の分類や要約など、決まった作業だけをさせるなら、小さなモデルで十分なことも多くあります。大きなモデルの知識を小さなモデルに移す「蒸留」も、こうした使い方のための方法です。

15

ニュースの数字の読み方:3つの順に確かめる

「700億パラメータの新しいモデルが登場」といったニュースを見たら、次の3つの順に確かめると、数字の意味を取り違えません。

  1. 公式の数字か:発表した会社の資料に書かれた数字か、記者や第三者の推定かを見る。
  2. 総数か、使う数か:MoEのモデルなら、総パラメータ数と1つの言葉あたりに使う数が大きく違う。
  3. 何と比べているか:作り方の違うモデルと数字だけで比べていないかを見る。

数字の大きさより、どんな作業でどれだけの成績だったか、という評価の結果のほうが、使うモデルを選ぶ材料になります。

16

モデル選びで、パラメータ数をどう見るか

ChatGPTなどのサービスを使うだけなら、パラメータ数を気にする必要はほとんどありません。用途に合う性能と料金で選べば十分です。

パラメータ数が選ぶ材料になるのは、主に次の場面です。

  1. 自分のPCやサーバーで動かす:必要なメモリと、手元の機器で動くかを計算するため。
  2. 同じ作り方のモデルの大小を比べる:同じシリーズの8Bと70Bのように、作り方が同じなら大きさの差が性能の差の目安になる。
  3. 費用や速さを見積もる:自分で動かすときの計算の重さを考えるため。
17

よくある3つの誤解

  1. パラメータ数が2倍なら、賢さも2倍:大きさと性能は比例しない。作り方やデータで大きく変わる。
  2. 名前の数字が正確なパラメータ数:gpt-oss-120bの総パラメータが117bのように、名前の数字は目安のことがある。
  3. 非公開のモデルの数字も分かっている:最新の主力モデルの多くは公表されておらず、出回る数字の多くは推定か噂。

この3つを押さえておくと、ニュースの数字に振り回されずに済みます。

18

パラメータ数の数字を読むときの確認リスト

最後に、ニュースや比較記事でパラメータ数を見たときの確認をまとめます。

  • 公式の発表の数字か、推定・噂の数字かを確かめた
  • 総パラメータ数か、1つの言葉あたりに使う数かを確かめた
  • 作り方が違うモデルを、数字だけで比べていない
  • 自分で動かすなら、パラメータ数から必要なメモリを計算した
  • サービスとして使うなら、パラメータ数より性能と料金で選んだ
QUICK ANSWERS

よくある疑問を、ここで。

使い始める前に、気になるところから。

AIのパラメータ数とは何ですか?

AI(ニューラルネットワーク)の中にある、学習で値が決まる数字(主に重みとバイアス)の個数です。モデルの大きさを表す目安として使われます。

パラメータ数が多いほど賢いのですか?

同じ作り方なら多いほど性能が上がる傾向はありますが、比例はしません。学習のデータや方法でも大きく変わり、OpenAIはgpt-oss-120bがo4-miniとほぼ同じ推論の結果になったと説明しています。

ChatGPTのパラメータ数はいくつですか?

公表されていません。OpenAIはGPT-4の技術報告でモデルの大きさを含む詳細を載せないとしており、2026年9月のGPT-6 Sol・Lunaの発表にもパラメータ数は書かれていません。

自分のPCで動かすには、どれくらいのメモリが要りますか?

重みだけの目安は「パラメータ数×1個あたりのバイト数」です。16ビットなら8Bで約16GB、4ビットに粗くすれば約4GBです。実際には会話の長さなどで、さらに余裕が必要です。

この記事の内容をもとにした、編集部からの提案です。
「アクティブなパラメータ」とは何ですか?

MoEという作り方のモデルで、1つの言葉を処理するときに実際に使うパラメータの数です。gpt-oss-120bは総パラメータ117Bのうち5.1Bを使うと公表されています。

この記事を共有する

X(旧Twitter)(新しいタブで開きます)LINE(新しいタブで開きます)はてなブックマーク(新しいタブで開きます)

商品情報の提供:Supported by Rakuten Developers

SOURCES & EDITORIAL NOTE

出典と、この記事について

公式資料や、記事で参照した発表・報道をまとめています。仕様や料金は、利用する前に最新の案内をご確認ください。

確認した内容と条件は本文に記載しています。結果や使い勝手は、資料や環境によって異なります。編集方針を読む