【PR】この記事には楽天アフィリエイト・Amazonアソシエイト・A8.netの広告リンクが含まれます。商品やサービスは公式の仕様・条件と販売情報を確認して選んでおり、実機テストによる評価ではありません。 Amazonのアソシエイトとして、PROBEFOLIOは適格販売により収入を得ています。
AIのニュースでは「80億パラメータ」「700億パラメータ」のような数字がよく出てきます。パラメータ数は、AIの中にある、学習で決まる数字の個数のことで、モデルの大きさを表す目安です。
この記事では、2026年9月25日に確認した各社の公式発表と論文をもとに、パラメータ数の意味と、ニュースの数字の正しい読み方を説明します。
この記事の目次
結論:学習で決まる数字の個数。多いほど表現力は上がるが、それだけで賢さは決まらない
パラメータは、AI(ニューラルネットワーク)の中にある、学習で値が決まる数字のことです。主に、重みとバイアスを指します。パラメータ数は、その個数です。
一般に、パラメータ数が多いほど、複雑な関係を学べる余地が大きくなります。ただし、学習に使ったデータの量や質、学習の方法でも性能は大きく変わるので、パラメータ数だけで賢さは決まりません。
よく出てくる言葉は、表「パラメータ数の読み方」のとおりです。
| 言葉 | 意味 | 例 |
|---|---|---|
| パラメータ | 学習で値が決まる数字(重み・バイアス) | 迷惑メールの判定の例では4個 |
| B(billion) | 10億 | 8B=80億、70B=700億 |
| 総パラメータ数 | モデル全体のパラメータの数 | gpt-oss-120bは約1,170億 |
| アクティブなパラメータ数 | 1つの言葉を処理するときに実際に使う数 | gpt-oss-120bは約51億 |
パラメータとは:迷惑メールの判定の例で4個
ニューラルネットワークをわかりやすくで使った迷惑メールの判定の例では、3つの手がかりの重み(3・4・1)と、基準のバイアス(−5)の、合わせて4個のパラメータがありました。
学習とは、これらの数字を、たくさんの例で間違いが少なくなるように直していくことです。学習が終わった後のパラメータの値に、AIが学んだことが詰まっています。
大規模言語モデルは、同じような数字を数十億から数千億個持っています。技術評論社の『大規模言語モデル入門』も、大規模言語モデルを「大規模なパラメータで構成されるニューラルネットワーク」と説明しています。
「B」の読み方:8Bは80億、70Bは700億
パラメータ数は、英語のbillion(10億)の頭文字を取って「B」で書かれることが多くあります。8Bなら80億、70Bなら700億、405Bなら4,050億です。
1兆を超えると、trillion(1兆)の「T」で書かれることもあります。日本語のニュースでは「700億パラメータ」のように、日本語の単位に直して書かれることもあります。
モデルの名前に数字が入っている場合、多くはパラメータ数を表しています。ただし、名前の数字と正確な数が少し違うこともあるので、公式の資料で確かめてください。
公開されている主なモデルの数字
重み(パラメータの値)を公開しているモデルの多くは、パラメータ数も公式に公表しています。2026年9月25日に公式の発表や論文で確かめた数字は、表「公式に公開されているパラメータ数」のとおりです。
OpenAIのgpt-oss-120bの名前は「120b」ですが、公式の総パラメータ数は117bです。名前の数字は目安で、正確な数は公式の表で確かめる必要があることが分かります。
| モデル(発表) | 総パラメータ数 | 1つの言葉あたりに使う数 |
|---|---|---|
| Llama 3.1(Meta、2024年7月) | 8B・70B・405B | 総数と同じ(MoEではない作り) |
| gpt-oss-20b(OpenAI、2025年8月) | 21B | 3.6B |
| gpt-oss-120b(OpenAI、2025年8月) | 117B | 5.1B |
| DeepSeek-V3(2024年12月) | 671B | 37B |
最新の主力モデルの多くは、パラメータ数を公表していない
ChatGPTなどで使われる最新の主力モデルは、パラメータ数を公表していないことが多くあります。OpenAIはGPT-4の技術報告で、競争の状況と安全性を理由に、モデルの大きさを含む設計の詳細を載せないと書いています。
2026年9月22日のGPT-6 Sol・Lunaの発表でも、性能や料金は示されていますが、パラメータ数は書かれていません。
そのため、非公開のモデルの数字をニュースやブログで見かけたら、公式の数字か、推定の数字かを必ず確かめてください。
噂の数字に注意する
非公開のモデルほど、根拠のはっきりしない数字が出回りやすくなります。検索の上位の記事の中には、GPT-4のパラメータ数を「100兆」と書いているものもありますが、OpenAIはGPT-4の大きさを公表していません。
推定の数字を扱うときは、誰が、どんな方法で推定したのかが書かれているかを見ます。書かれていなければ、その数字を判断の材料にしないほうが安全です。
比べるときは、公式に公開された数字だけで比べるか、推定の数字には「推定」とはっきり書いて区別します。
多いほど賢いのか:大きさ以外で決まる部分も大きい
一般に、同じ作り方なら、パラメータ数が多いほど性能が上がる傾向があります。『大規模言語モデル入門』の目次にも、「モデルの大規模化とその効果」という節があります。
ただし、作り方が違えば話は変わります。OpenAIは、gpt-oss-120b(総パラメータ117B)が、中心的な推論のテストで自社のo4-miniとほぼ同じ結果になったと説明しています。
学習に使ったデータの量と質、学習の後の調整、考える量の設定などで、同じくらいの大きさでも性能は大きく変わります。パラメータ数は「大きさ」の目安で、「賢さ」の点数ではないと考えてください。
総パラメータとアクティブなパラメータ:MoEという作り方
最近のモデルには、たくさんの「専門家」の部分を持ち、言葉ごとにその一部だけを使うMoE(mixture-of-experts)という作り方があります。
OpenAIのgpt-oss-120bは、総パラメータが117Bですが、1つの言葉を処理するときに使うのは5.1Bです。DeepSeek-V3も、総パラメータ671Bのうち、1つの言葉あたり37Bを使います。
使う数が少ないので、総パラメータ数のわりに計算が軽くなります。ニュースでパラメータ数を見るときは、総数なのか、実際に使う数なのかも確かめてください。
動かすのに必要なメモリを計算する
モデルを動かすには、パラメータの値をすべてメモリに読み込む必要があります。必要なメモリの目安は、「パラメータ数 × 1個あたりのバイト数」で計算できます。
1個の数字を16ビット(2バイト)で持つなら、8Bのモデルで約16GB、70Bのモデルで約140GBです。4ビット(0.5バイト)まで粗くすれば、8Bで約4GB、70Bで約35GBになります。
これは重みだけの目安で、実際には、会話の長さなどに応じてさらにメモリを使います。計算した数字より余裕のあるメモリを用意するのが安全です。
| パラメータ数 | 16ビット(2バイト) | 4ビット(0.5バイト) |
|---|---|---|
| 8B(80億) | 約16GB | 約4GB |
| 21B(210億) | 約42GB | 約10.5GB |
| 70B(700億) | 約140GB | 約35GB |
| 405B(4,050億) | 約810GB | 約203GB |
量子化:数字を粗くしてメモリを減らす
1個の数字をより少ないビットで持つように粗くすることを、量子化と呼びます。16ビットを4ビットにすれば、必要なメモリはおよそ4分の1になります。
OpenAIは、gpt-oss-20bがわずか16GBのメモリの機器で動き、gpt-oss-120bが80GBのGPU 1枚で効率よく動くと説明しています。総パラメータの数だけから計算するより、ずっと少ないメモリで動く作りになっています。
粗くしすぎると、答えの質が落ちることがあります。どこまで粗くするかは、用途と、手元の機器のメモリで決めます。
自分のPCで動かすなら:GPUのメモリが目安
重みを公開しているモデルは、自分のPCで動かすこともできます。速く動かすには、GPU(画像処理の部品)のメモリに、モデルの重みが収まることが大きな目安になります。
表「重みを読み込むのに必要なメモリの目安」を見ると、8Bのモデルを4ビットで動かすなら数GB、21Bなら10GBほどが必要です。GPUのメモリが足りない場合は、PCのメインのメモリとCPUで動かす方法もありますが、遅くなります。
GPUを使わない場合の試し方は、ローカルLLMはGPUなしで使える?CPUだけで日本語3課題を試した結果で説明しています。
パラメータ数と、料金・速さの関係
一般に、パラメータ数が多く、1つの言葉あたりに使う数が多いほど、計算が重くなり、答えが出るまでの時間と費用が増えます。
APIの料金は、多くの場合、モデルの大きさではなく、読み込ませた量と書かせた量(トークン)で決まります。たとえば2026年9月22日の発表では、GPT-6 Solの料金はLunaの20倍でした。OpenAIは両方の大きさを公表していません。
つまり、料金の差は、大きさや計算の重さの違いを反映していると考えられますが、公開されていない以上、料金からパラメータ数を逆算することはできません。
大きくなってきた流れと、学習データの量
LoRAの論文は、2020年のGPT-3を1,750億パラメータのモデルとして扱っています。その後、公開されたモデルでも、Llama 3.1の405Bや、DeepSeek-V3の671Bのように、さらに大きなものが出てきました。
大きさと一緒に、学習に使う文章の量も増えています。MetaはLlama 3.1 405Bを15兆トークンを超える文章で、DeepSeek-V3は14.8兆トークンで学習したと説明しています。
大きなモデルほど、たくさんのデータと計算が必要です。パラメータ数は、モデルを作るための費用の大きさを表す数字でもあります。
小さなモデルの使いどころ
パラメータ数が小さいモデルにも、はっきりした使いどころがあります。必要なメモリが少なく、答えが速く、動かす費用も安く済むことです。
OpenAIが16GBのメモリの機器で動くと説明しているgpt-oss-20bのように、手元のPCやスマホに近い機器で動かせるモデルなら、データを外に送らずに使えます。
文章の分類や要約など、決まった作業だけをさせるなら、小さなモデルで十分なことも多くあります。大きなモデルの知識を小さなモデルに移す「蒸留」も、こうした使い方のための方法です。
ニュースの数字の読み方:3つの順に確かめる
「700億パラメータの新しいモデルが登場」といったニュースを見たら、次の3つの順に確かめると、数字の意味を取り違えません。
- 公式の数字か:発表した会社の資料に書かれた数字か、記者や第三者の推定かを見る。
- 総数か、使う数か:MoEのモデルなら、総パラメータ数と1つの言葉あたりに使う数が大きく違う。
- 何と比べているか:作り方の違うモデルと数字だけで比べていないかを見る。
数字の大きさより、どんな作業でどれだけの成績だったか、という評価の結果のほうが、使うモデルを選ぶ材料になります。
モデル選びで、パラメータ数をどう見るか
ChatGPTなどのサービスを使うだけなら、パラメータ数を気にする必要はほとんどありません。用途に合う性能と料金で選べば十分です。
パラメータ数が選ぶ材料になるのは、主に次の場面です。
- 自分のPCやサーバーで動かす:必要なメモリと、手元の機器で動くかを計算するため。
- 同じ作り方のモデルの大小を比べる:同じシリーズの8Bと70Bのように、作り方が同じなら大きさの差が性能の差の目安になる。
- 費用や速さを見積もる:自分で動かすときの計算の重さを考えるため。
よくある3つの誤解
- パラメータ数が2倍なら、賢さも2倍:大きさと性能は比例しない。作り方やデータで大きく変わる。
- 名前の数字が正確なパラメータ数:gpt-oss-120bの総パラメータが117bのように、名前の数字は目安のことがある。
- 非公開のモデルの数字も分かっている:最新の主力モデルの多くは公表されておらず、出回る数字の多くは推定か噂。
この3つを押さえておくと、ニュースの数字に振り回されずに済みます。
パラメータ数の数字を読むときの確認リスト
最後に、ニュースや比較記事でパラメータ数を見たときの確認をまとめます。
- 公式の発表の数字か、推定・噂の数字かを確かめた
- 総パラメータ数か、1つの言葉あたりに使う数かを確かめた
- 作り方が違うモデルを、数字だけで比べていない
- 自分で動かすなら、パラメータ数から必要なメモリを計算した
- サービスとして使うなら、パラメータ数より性能と料金で選んだ
よくある疑問を、ここで。
使い始める前に、気になるところから。
AIのパラメータ数とは何ですか?
AI(ニューラルネットワーク)の中にある、学習で値が決まる数字(主に重みとバイアス)の個数です。モデルの大きさを表す目安として使われます。
パラメータ数が多いほど賢いのですか?
同じ作り方なら多いほど性能が上がる傾向はありますが、比例はしません。学習のデータや方法でも大きく変わり、OpenAIはgpt-oss-120bがo4-miniとほぼ同じ推論の結果になったと説明しています。
ChatGPTのパラメータ数はいくつですか?
公表されていません。OpenAIはGPT-4の技術報告でモデルの大きさを含む詳細を載せないとしており、2026年9月のGPT-6 Sol・Lunaの発表にもパラメータ数は書かれていません。
自分のPCで動かすには、どれくらいのメモリが要りますか?
重みだけの目安は「パラメータ数×1個あたりのバイト数」です。16ビットなら8Bで約16GB、4ビットに粗くすれば約4GBです。実際には会話の長さなどで、さらに余裕が必要です。
「アクティブなパラメータ」とは何ですか?
MoEという作り方のモデルで、1つの言葉を処理するときに実際に使うパラメータの数です。gpt-oss-120bは総パラメータ117Bのうち5.1Bを使うと公表されています。
この記事を共有する
商品情報の提供:Supported by Rakuten Developers
出典と、この記事について
公式資料や、記事で参照した発表・報道をまとめています。仕様や料金は、利用する前に最新の案内をご確認ください。
- Meta:Introducing Llama 3.1(2024年7月23日)(新しいタブで開きます)
- OpenAI:gpt-oss が登場(2025年8月5日)(新しいタブで開きます)
- DeepSeek-V3 Technical Report(2024年)(新しいタブで開きます)
- OpenAI:GPT-4 Technical Report(2023年)(新しいタブで開きます)
- OpenAI:Introducing GPT-6 Sol and Luna(2026年9月22日)(新しいタブで開きます)
- Hu ほか「LoRA: Low-Rank Adaptation of Large Language Models」(2021年)(新しいタブで開きます)
- 技術評論社:大規模言語モデル入門(概要・目次)(新しいタブで開きます)
確認した内容と条件は本文に記載しています。結果や使い勝手は、資料や環境によって異なります。編集方針を読む




ぜひコメントください