【PR】この記事には楽天アフィリエイト・Amazonアソシエイトの広告リンクが含まれます。商品やサービスは公式の仕様・条件と販売情報を確認して選んでおり、実機テストによる評価ではありません。 Amazonのアソシエイトとして、PROBEFOLIOは適格販売により収入を得ています。
適合率と再現率は、AIの分類の成績を測る指標です。どちらも「当たった割合」に見えるので混ざりやすいのですが、「どこから見た割合か」を押さえると区別できます。
この記事では、2026年9月25日に確認したGoogleの機械学習の教材の定義をもとに、迷惑メールの例で計算しながら、混ざらない覚え方と使い分けを説明します。
この記事の目次
結論:適合率は「AIの答え側」から、再現率は「本当の答え側」から見る
Googleの機械学習の教材は、適合率を「モデルが陽性と分類したもののうち、本当に陽性だったものの割合」、再現率を「本当に陽性のもののうち、正しく陽性と分類できたものの割合」と定義しています。
違いは、割合の「分母」です。適合率はAIが陽性と言った数で割り、再現率は本当の陽性の数で割ります。 ここさえ押さえれば、混ざりません。
2つの指標の違いは、表「適合率と再現率の違い」のとおりです。
| 指標 | 分母(どこから見るか) | 一言でいうと |
|---|---|---|
| 適合率(Precision) | AIが陽性と言った数 | 言ったことの正しさ |
| 再現率(Recall) | 本当に陽性の数 | 見逃しの少なさ |
| 正解率(Accuracy) | 全部の数 | 全体の当たりの割合 |
混ざらない覚え方:3つの言いかえ
覚え方はいくつかあります。自分に合うものを1つ選び、問題を解くたびに使ってください。
- 漢字で覚える:「適合」はAIの答えが正解に適合(合っている)か、「再現」は本当の陽性をどれだけ再現(拾い上げ)できたか。
- 場面で覚える:適合率は「言いすぎていないか」、再現率は「見逃していないか」。
- 分母で覚える:適合率は「AIの陽性」、再現率は「本当の陽性」で割る。
迷ったら、「今、どちらの集まりの中で割合を数えているか」を自分に聞いてください。AIが選んだ集まりなら適合率、本当の陽性の集まりなら再現率です。
身近な例:スマホの写真アプリで「犬」を検索する
スマホの写真アプリで「犬」と検索したときを思い浮かべてください。出てきた写真の中に、猫やぬいぐるみが混ざっていたら、「言いすぎ」が多い状態です。これは適合率が低いということです。
反対に、出てきた写真は全部犬でも、自分が撮った犬の写真の半分しか出てこなければ、「見逃し」が多い状態です。これは再現率が低いということです。
「出てきた中に違うものが混ざる」なら適合率、「出てくるべきものが出てこない」なら再現率、と身近な体験に結びつけると、忘れにくくなります。
4つのマスで整理する:混同行列
AIの判定と本当の答えの組み合わせは、4通りあります。これを表にしたものを混同行列と呼びます。迷惑メールの判定を例にします。
本当に迷惑メールで、AIも迷惑メールと判定したものが「真陽性(TP)」、本当は普通なのに迷惑メールと判定したものが「偽陽性(FP)」です。
本当は迷惑メールなのに普通と判定したものが「偽陰性(FN)」、本当に普通で普通と判定したものが「真陰性(TN)」です。表「迷惑メールの混同行列」は、1,000通の例です。
| 本当の答え | AIが迷惑メールと判定 | AIが普通と判定 |
|---|---|---|
| 本当に迷惑メール(50通) | TP:40通 | FN:10通(見逃し) |
| 本当は普通のメール(950通) | FP:5通(言いすぎ) | TN:945通 |
迷惑メールの例で計算する
表「迷惑メールの混同行列」の数字で計算します。適合率は、AIが迷惑メールと判定した45通(40+5)のうち、本当に迷惑メールだった40通の割合で、40÷45=約88.9%です。
再現率は、本当に迷惑メールだった50通(40+10)のうち、AIが見つけた40通の割合で、40÷50=80.0%です。
同じ40通でも、割る数が違うので、答えが違います。分子はどちらもTP(当たった陽性)で、分母だけが違うと覚えておくと、計算で迷いません。
| 指標 | 計算 | 結果 |
|---|---|---|
| 適合率 | TP ÷(TP+FP)=40 ÷ 45 | 約88.9% |
| 再現率 | TP ÷(TP+FN)=40 ÷ 50 | 80.0% |
| 正解率 | (TP+TN)÷ 全部 = 985 ÷ 1,000 | 98.5% |
正解率だけではだめな理由
迷惑メールの例の正解率は98.5%で、とても高く見えます。ところが、「全部のメールを普通と判定する」何もしないAIでも、正解率は950÷1,000=95%になります。
このAIは、迷惑メールを1通も見つけられないので、再現率は0%です。陽性がとても少ないデータでは、正解率が高くても役に立たないことがあります。
Googleの教材も、正解率はデータの陽性と陰性の数がほぼ同じときに向いていると説明しています。数に偏りがあるときは、適合率と再現率を一緒に見ます。
適合率と再現率は綱引きの関係
AIは多くの場合、「迷惑メールらしさ」の点数を出し、ある基準より高ければ迷惑メールと判定します。この基準を厳しくするか、ゆるくするかで、2つの指標が逆向きに動きます。
基準を厳しくすると、確実なものだけを迷惑メールと判定するので、適合率は上がり、再現率は下がります。ゆるくすると、疑わしいものも拾うので、再現率は上がり、適合率は下がります。
例は表「基準を変えたときの違い」のとおりです。どちらかを上げると、もう一方が下がりやすいので、場面に合わせてどちらを重視するかを決めます。
| 基準 | TP・FP・FN | 適合率・再現率 |
|---|---|---|
| 厳しい | TP 30・FP 1・FN 20 | 96.8%・60.0% |
| ふつう | TP 40・FP 5・FN 10 | 88.9%・80.0% |
| ゆるい | TP 48・FP 30・FN 2 | 61.5%・96.0% |
場面別:どちらを重視するか
Googleの教材は、偽陰性(見逃し)のほうが偽陽性より困るときは再現率を、陽性という判定が正確であることが大事なときは適合率を使う、と説明しています。
身近な場面に当てはめると、表「場面別に重視する指標」のようになります。「見逃したときと、言いすぎたとき、どちらの損が大きいか」で考えます。
| 場面 | 重視する指標 | 理由 |
|---|---|---|
| 迷惑メールの振り分け | 適合率 | 大事なメールを迷惑メールに入れると困る |
| 病気の1次検査 | 再現率 | 病気の人を見逃すと困る |
| 工場の不良品の検査 | 再現率 | 不良品を出荷すると困る |
| おすすめ商品の表示 | 適合率 | 合わない商品ばかりだと信頼を失う |
| クレジットカードの不正利用の検知 | 再現率 | 不正を見逃すと損が大きい |
病気の検査の例:再現率を重視する
1,000人のうち20人が病気だとします。検査で18人を陽性と見つけ、2人を見逃しました。病気でない980人のうち50人を、間違って陽性と判定しました。
再現率は18÷20=90.0%で、見逃しは少なめです。一方で、適合率は、陽性と判定された68人(18+50)のうち本当に病気の18人で、約26.5%しかありません。
1次検査では、見逃さないことを優先して再現率を高くし、陽性の人をより詳しい2次検査で確かめる、という組み合わせがよく使われます。適合率が低いこと自体は、この使い方なら問題になりにくいのです。
| 指標 | 計算 | 結果 |
|---|---|---|
| 再現率 | 18 ÷ 20 | 90.0% |
| 適合率 | 18 ÷(18+50) | 約26.5% |
| 正解率 | (18+930)÷ 1,000 | 約94.8% |
不良品の検査の例:見逃しを減らしたい
1,000個の製品のうち10個が不良品で、検査で9個を見つけ、1個を見逃したとします。良品990個のうち20個を、間違って不良品と判定しました。
再現率は9÷10=90.0%、適合率は9÷29=約31.0%です。不良品と判定された29個は、人がもう一度確かめれば、良品の20個は出荷に戻せます。
不良品を1個でも出荷すると、交換や信用の損が大きい場合は、再現率を優先します。逆に、確かめ直しの手間が大きすぎる場合は、適合率とのバランスを取ります。
基準の決め方:見逃しと言いすぎの損を比べる
綱引きのどこで止めるかは、見逃しと言いすぎのそれぞれで、どれだけ困るかを比べて決めます。次の順で考えると、決めやすくなります。
- 陽性を決める:何を見つけたいのか(迷惑メール、病気、不良品など)をはっきりさせる。
- 2つの損を書き出す:見逃したときに起きること、言いすぎたときに起きることを、手間やお金で書き出す。
- 損の大きいほうを減らす:見逃しの損が大きければ基準をゆるく(再現率を重視)、言いすぎの損が大きければ厳しく(適合率を重視)する。
損を書き出すと、関係者の間で「どちらを重視するか」の話がまとまりやすくなります。
両方をまとめて見る:F値(F1スコア)
適合率と再現率を1つの数字で見たいときに使うのが、F値(F1スコア)です。2×適合率×再現率÷(適合率+再現率)で計算します。
迷惑メールの例では、2×0.889×0.8÷(0.889+0.8)で約84.2%です。基準を変えた例では、厳しい基準が約74.1%、ゆるい基準が75.0%でした。
F値は、どちらか一方だけが高くても上がりません。適合率と再現率のどちらを重視するか決めにくいとき、全体のバランスを比べる目安になります。
F値が普通の平均でない理由
適合率100%、再現率2%のAIを考えます。本当の陽性をほとんど見逃しているので、役に立ちません。ところが、普通の平均を取ると(100+2)÷2=51%で、まずまずに見えてしまいます。
F値で計算すると、2×1×0.02÷1.02で約3.9%になります。F値は、低いほうの値に引っ張られる計算(調和平均)なので、片方だけが極端に低いAIを見逃しません。
だからこそ、F値は「両方がそこそこ高いか」を見る指標として使われます。ただし、見逃しと言いすぎの損が大きく違う場面では、F値だけで決めず、重視する側の指標も見てください。
練習問題:3問で確かめる
覚え方を使って、次の3問を解いてみてください。答えはこの節の最後の表にあります。
- 問題1:100件のうち、AIが陽性と言ったのは10件で、そのうち本当に陽性は8件。本当の陽性は全部で12件。適合率と再現率は?
- 問題2:本当の陽性50件のうち45件を見つけた。AIが陽性と言ったのは60件。適合率と再現率は?
- 問題3:病気の見逃しを減らしたい検査で、基準を厳しくするべきか、ゆるくするべきか?
問題1と2は、分母がどちらかを先に決めてから計算すると、迷わずに解けます。問題3は、見逃しと言いすぎのどちらを減らしたいかを考えます。
| 問題 | 答え | 考え方 |
|---|---|---|
| 問題1 | 適合率80.0%・再現率約66.7% | 8÷10、8÷12 |
| 問題2 | 適合率75.0%・再現率90.0% | 45÷60、45÷50 |
| 問題3 | ゆるくする | 再現率を上げたいから |
表計算で計算する
ExcelやGoogleスプレッドシートで、TP・FP・FNの数をセルに入れておけば、指標をすぐに計算できます。2行目のA2にTP、B2にFP、C2にFNを入れたとします。
適合率は「=A2/(A2+B2)」、再現率は「=A2/(A2+C2)」、F値は「=2*D2*E2/(D2+E2)」(D2に適合率、E2に再現率)で計算できます。
基準を変えたときのTP・FP・FNを行ごとに並べておけば、綱引きの様子を表で比べられます。仕事でAIのツールを評価するときにも、そのまま使えます。
3つ以上に分けるときは、分類ごとに計算する
写真を猫・犬・鳥に分けるように、3つ以上に分類するときは、分類ごとに「その分類を陽性、ほかを陰性」とみなして、適合率と再現率を計算します。
たとえば猫の再現率は、本当の猫の写真のうち、猫と判定できた割合です。分類ごとの数字を見ると、どの分類が苦手かが分かります。
全体の成績としてまとめるときは、分類ごとの値を平均することがよくあります。
分類ごとの数に大きな差があるときは、平均だけを見ると、数の少ない分類の苦手さが隠れてしまいます。分類ごとの数字も必ず一緒に見てください。
AIの使い方の中でも出てくる
社内の資料を探して生成AIに答えさせる方法(RAG)の評価でも、同じ考え方が使われます。必要な資料をどれだけ取りこぼさずに探せたかは再現率、探した資料のうち本当に必要だったものの割合は適合率の考え方です。
AIの文章の判定ツールでも、人の文章をAIと言いすぎる(偽陽性)ことが問題になります。指標の意味が分かると、ツールの成績の数字を正しく読めるようになります。
ツールの宣伝で「精度95%」とだけ書かれていたら、それが正解率なのか、適合率や再現率なのかを確かめてください。
資格の勉強で押さえたい点
データサイエンティスト協会のDS検定の出題範囲では、データサイエンスの「モデル化」の中に、回帰・分類や統計的評価が含まれています。適合率と再現率は、分類の評価の基本です。
試験では、混同行列から計算させる問題や、場面に合う指標を選ばせる問題の形で問われやすい内容です。電卓を使えない試験もあるので、分数のまま計算する練習もしておくと安心です。
混ざりやすい3つの原因
- どちらも「当たった割合」に見える:分子は同じTPなので、分母を確かめないと区別できない。
- 英語の名前だけで覚えている:PrecisionとRecallの意味をつかまないと、日本語の問題で迷う。
- 陽性が何かを決めていない:迷惑メールを陽性にするか、普通のメールを陽性にするかで、数字が入れかわる。
問題を解く前に、「陽性は何か」「分母はどちらか」の2つを書き出すだけで、混ざることがぐっと減ります。
よくある疑問を、ここで。
使い始める前に、気になるところから。
適合率と再現率の違いを一言でいうと?
適合率は「AIが陽性と言ったものの正しさ」、再現率は「本当の陽性をどれだけ見逃さずに拾えたか」です。分子はどちらも当たった陽性で、分母が違います。
どちらを重視すればよいですか?
見逃しのほうが困るなら再現率、陽性という判定の正確さが大事なら適合率を重視します。病気の1次検査や不良品の検査は再現率、迷惑メールの振り分けやおすすめの表示は適合率が目安です。
正解率が高ければ十分ではないのですか?
陽性がとても少ないデータでは、全部を陰性と言うだけで正解率が高くなります。迷惑メールが5%なら、全部を普通と判定しても正解率は95%ですが、再現率は0%です。
F値とは何ですか?
適合率と再現率のバランスを1つの数字にしたものです。2×適合率×再現率÷(適合率+再現率)で計算し、片方だけが高くても上がりません。
両方を同時に上げることはできますか?
基準を変えるだけでは、一方を上げるともう一方が下がりやすくなります。両方を上げるには、データを増やす、特徴を見直すなど、AIの判定そのものを良くする必要があります。
この記事を共有する
商品情報の提供:Supported by Rakuten Developers
出典と、この記事について
公式資料や、記事で参照した発表・報道をまとめています。仕様や料金は、利用する前に最新の案内をご確認ください。
- Google Machine Learning Crash Course:Accuracy, recall, precision, and related metrics(新しいタブで開きます)
- データサイエンティスト協会:DS検定とは(新しいタブで開きます)
確認した内容と条件は本文に記載しています。結果や使い勝手は、資料や環境によって異なります。編集方針を読む




ぜひコメントください