【PR】この記事には楽天アフィリエイト・Amazonアソシエイトの広告リンクが含まれます。商品やサービスは公式の仕様・条件と販売情報を確認して選んでおり、実機テストによる評価ではありません。 Amazonのアソシエイトとして、PROBEFOLIOは適格販売により収入を得ています。
転移学習とファインチューニングは、どちらも「学習済みのモデルを、別の課題に生かす」方法です。違いは、学習済みのモデルのどこまでを学習し直すかにあります。
この記事では、2026年9月25日に確認したTensorFlowの公式チュートリアルと論文をもとに、層の図で違いを示し、データの量と目的から選ぶ方法を説明します。
この記事の目次
結論:違いは「学習済みのモデルのどこまでを学習し直すか」
TensorFlowの公式チュートリアルは、学習済みのモデルを生かす方法として、特徴抽出とファインチューニングの2つを紹介しています。どちらも、転移学習と呼ばれる考え方の中の方法です。
特徴抽出は、学習済みの部分を固定し、新しく足した出口の部分だけを学習します。ファインチューニングは、それに加えて、学習済みの上の層の一部も一緒に学習し直します。違いは、学習済みの部分に手を入れるかどうかです。
2つの方法の違いは、表「転移学習の2つの方法」のとおりです。
| 方法 | 学習し直す所 | 向いている場面の目安 |
|---|---|---|
| 特徴抽出(狭い意味の転移学習) | 新しく足した出口だけ | データが少ない、元の課題に近い |
| ファインチューニング | 新しい出口+学習済みの上の層の一部 | データがある程度ある、元の課題と違いがある |
「転移学習」には広い意味と狭い意味がある
2つの言葉が混ざりやすいのは、「転移学習」が2つの意味で使われているためです。
- 広い意味:学習済みのモデルを、別の課題に生かす考え方の総称。特徴抽出もファインチューニングも含む。
- 狭い意味:学習済みの部分を固定し、新しい出口だけを学習する方法。特徴抽出と同じ意味。
「転移学習とファインチューニングの違い」を説明する記事の多くは、狭い意味で比べています。資料を読むときは、どちらの意味で使っているかを確かめると混乱しません。
この記事では、狭い意味の転移学習を「特徴抽出」と呼んで、ファインチューニングと区別します。
たとえ:経理の経験者が、別の会社の経理を覚える
経理を5年経験した人が、別の会社に移ったとします。帳簿のつけ方や、数字の確かめ方といった基本は、前の会社で身につけたものがそのまま使えます。
新しく覚えるのは、その会社独自の勘定科目や、申請の流れだけです。これが、学習済みの部分を固定して、新しい出口だけを学ぶ特徴抽出のイメージです。
業界がまったく違う会社なら、基本のやり方の一部も、その業界に合わせて直す必要が出てきます。これが、学習済みの部分の一部まで学習し直すファインチューニングのイメージです。
なぜ学習済みのモデルを使うのか
TensorFlowのチュートリアルは、大きく一般的なデータで学習したモデルは、画像の世界の一般的なモデルとして働くため、一から学習しなくても、その学習済みの特徴を生かせると説明しています。
一からモデルを学習させるには、大量のデータと計算が必要です。学習済みのモデルを使えば、手元のデータが少なくても、短い時間と少ない計算で、それなりの成績を出せます。
手元のデータが少なくても始めやすく、データを集める手間を大きく減らせるのが一番の利点です。
層ごとの役割:入口は一般的、出口は課題に特有
ニューラルネットワークの層は、入口に近いほど一般的な特徴を、出口に近いほど課題に特有の特徴を学びます。画像なら、入口の層は線や色、真ん中は形や模様、出口は「猫か犬か」の判断です。
TensorFlowのチュートリアルも、学習済みのモデルの土台には画像の分類に一般的に役立つ特徴が含まれる一方、最後の分類の部分は元の課題に特有だと説明しています。流れは、図「層ごとの役割と、学習し直す所」のとおりです。
層ごとの役割と、学習し直す所
- 入口に近い層
線・色・明るさなど一般的な特徴。どちらの方法でも固定する
- 真ん中の層
形・模様など。特徴抽出では固定、ファインチューニングでも多くは固定
- 出口に近い上の層
課題に近い特徴。ファインチューニングでは学習し直す
- 新しい出口
新しい課題の答えを出す部分。どちらの方法でも新しく学習する
入口の層は、どんな画像でも役立つ特徴なので、固定したまま使います。
元の課題と新しい課題の違いが大きいほど、学習し直す層を増やす必要が出てきます。
特徴抽出:学習済みの部分を固定し、出口だけ学習する
TensorFlowのチュートリアルは、特徴抽出を、学習済みのネットワークが学んだ表現を使って新しい例から特徴を取り出し、その上に新しい分類器を足して一から学習する方法だと説明しています。
学習済みの部分は「凍結」して、重みが変わらないようにします。チュートリアルも、学習の前に土台を凍結することが大事だと書いています。
学習する重みが少ないので、データが少なくても過学習しにくく、計算も軽く済みます。まず試す方法として、手軽で失敗が少ないのが特徴抽出です。
ファインチューニング:上の層の一部も一緒に学習し直す
TensorFlowのチュートリアルは、ファインチューニングを、凍結した土台の上の方の層をいくつか解凍し、新しく足した分類器と一緒に学習させる方法だと説明しています。
上の層の特徴を、新しい課題により合うように「微調整」するのが目的です。元の課題と新しい課題が少し違うときに、特徴抽出より成績を上げられることがあります。
一方で、学習する重みが増えるので、データが少ないと過学習しやすくなります。学習済みの特徴を壊さないよう、慎重に進める必要があります。
順番が大事:まず特徴抽出、次にファインチューニング
TensorFlowのチュートリアルは、まず土台を凍結して新しい分類器を学習させ、その後で上の層を解凍してファインチューニングする、という順番で進めています。
最初から全部を学習させると、まだ学習していない新しい分類器から大きな誤差が流れ込み、学習済みの特徴を崩してしまうおそれがあるためです。
また、チュートリアルは、バッチ正規化の層は解凍した後も推論のモードのままにするよう注意しています。そうしないと、学習済みの内容が壊れると説明しています。
例で見る:工場の製品写真で不良品を見分ける
工場で、製品の写真から不良品を見分けるAIを作るとします。手元の写真は、良品と不良品を合わせて1,000枚ほどです。
まず、大量の一般的な写真で学習済みのモデルを用意し、土台を凍結して「良品か不良品か」を答える出口だけを学習させます(特徴抽出)。これで成績が足りれば、ここで終えます。
傷の細かい違いなど、一般的な写真とは違う特徴が大事な場合は、上の層を解凍してファインチューニングします。検証用の写真で、成績が上がったかを確かめながら進めます。
選び方:データの量と、元の課題との近さ
どちらを選ぶかは、手元のデータの量と、元の課題(学習済みのモデルが学んだ課題)との近さで考えます。目安は、表「データの量と近さで選ぶ」のとおりです。
迷ったら、まず特徴抽出で試し、成績が足りないときにファインチューニングへ進むのが安全です。TensorFlowのチュートリアルも、この順番で進めています。
| 手元のデータ | 元の課題との近さ | 選ぶ方法の目安 |
|---|---|---|
| 少ない | 近い | 特徴抽出 |
| 少ない | 遠い | 特徴抽出から始め、入口寄りの特徴も試す |
| ある程度ある | 近い | 上の層だけファインチューニング |
| 多い | 遠い | 学習し直す層を増やす、全体の微調整も検討 |
成績の確かめ方:3つを同じ検証用データで比べる
どの方法がよいかは、同じ検証用のデータで成績を比べて決めます。比べるのは、次の3つです。
- 学習済みのモデルをそのまま使った場合:何も学習させないときの成績。比べる土台になる。
- 特徴抽出の場合:新しい出口だけを学習させたときの成績。
- ファインチューニングの場合:上の層の一部も学習させたときの成績。
2から3で成績が上がらない、または下がるなら、ファインチューニングは要りません。 学習し直す層を増やすほど手間と過学習の危険が増えるので、成績が上がる分だけ進めます。
LLMの「ファインチューニング」との関係
ChatGPTのような大規模言語モデル(LLM)でも、ファインチューニングという言葉がよく使われます。大量の文章で事前学習したモデルを、特定の目的に合わせて追加で学習させることです。
技術評論社の『大規模言語モデル入門』の目次には、事前学習とファインチューニング、指示チューニングの章が並んでいます。
オライリー・ジャパンの『ゼロから作るDeep Learning ❻ LLM編』も、事前学習の後のSFT(教師ありファインチューニング)を扱っています。
考え方は画像の例と同じで、「学習済みの知識を土台に、新しい目的に合わせて一部を学習し直す」ことです。
LoRA:学習し直す量を大きく減らす方法
LLMは重みの数がとても多いので、全部をファインチューニングすると、計算とメモリがたくさん必要です。そこで、学習し直す量を減らす方法が考えられてきました。
代表がLoRAです。2021年の論文は、GPT-3(1,750億パラメータ)の全体をファインチューニングする場合と比べ、学習するパラメータを1万分の1、必要なGPUのメモリを3分の1にできたと報告しています。
論文は、品質は全体のファインチューニングと同じか、それ以上だったとしています。元の重みは固定したまま、小さな追加の部分だけを学習するので、特徴抽出とファインチューニングの間のような方法とも言えます。
RAGとの違い:モデルを変えずに、資料を渡す
RAG(検索拡張生成)は、モデルの重みは変えずに、質問に関係する資料を検索して、答えを作るときに一緒に渡す方法です。2020年の論文は、学習済みのモデルに、検索できる外部の知識を組み合わせる方法として提案しました。
論文は、答えの根拠を示せることや、知識を更新しやすいことを利点に挙げています。社内の規程や、よく変わる情報を答えさせたいなら、ファインチューニングよりRAGのほうが合うことが多いです。
選び方は、RAGとファインチューニングの違い|社内資料をAIへ渡すときの選び方で詳しく説明しています。
蒸留との違い:大きなモデルの知識を小さなモデルへ
蒸留は、大きなモデル(または複数のモデル)の知識を、小さなモデルに移す方法です。2015年の論文は、複数のモデルの知識を、配りやすい1つのモデルに圧縮する方法として説明しています。
転移学習が「同じモデルを別の課題に生かす」のに対して、蒸留は「同じ課題を、より小さなモデルでこなせるようにする」ことが目的です。
スマホなど、計算の力が小さい機器で動かしたいときに使われます。小さくしたモデルを、さらに自分の課題に合わせてファインチューニングする、という組み合わせもあります。
4つの方法の比べ方
ここまでの方法を、何を変えるかと、向いている目的で並べると、表「4つの方法の比べ方」のとおりです。
「モデルに新しいことを覚えさせたい」ならファインチューニング、「覚えさせずに資料を見せたい」ならRAG、「小さく軽くしたい」なら蒸留、と目的から選ぶと迷いにくくなります。
| 方法 | 何を変えるか | 向いている目的 |
|---|---|---|
| 特徴抽出 | 新しい出口だけを学習 | 少ないデータで新しい分類を作る |
| ファインチューニング | 出口と、学習済みの層の一部 | 新しい課題により合わせる |
| RAG | モデルは変えず、資料を検索して渡す | 社内資料やよく変わる情報を答える |
| 蒸留 | 小さなモデルを新しく学習させる | 軽くして速く動かす |
気をつけたい3つの点
- 過学習:学習し直す層を増やすほど、少ないデータに合わせすぎやすい。検証用のデータで確かめながら進める。
- 元の力が落ちる:新しい課題に合わせすぎると、学習済みのモデルが持っていた一般的な力が弱まることがある。
- 使ってよいモデルか:学習済みのモデルには、使い方の条件(ライセンス)がある。仕事で使う前に、商用で使えるかを確かめる。
過学習の見つけ方と対策は、過学習の対策で説明しています。
手間と費用の目安
特徴抽出は、学習する重みが少ないので、ふつうのパソコンやクラウドの小さな計算機でも試せることが多い方法です。
ファインチューニングは、学習する重みが増える分、計算とメモリが多く必要です。LLMの全体を微調整するなら、大きなGPUを何台も使うことになります。LoRAのような方法を使うと、必要な量を大きく減らせます。
どちらも、一番手間がかかるのは、正解の付いた学習用のデータを用意することです。データの準備の時間も、計画に入れておいてください。
よくある疑問を、ここで。
使い始める前に、気になるところから。
転移学習とファインチューニングの違いを一言でいうと?
転移学習は、学習済みのモデルを別の課題に生かす考え方の総称です。そのうち、学習済みの層の一部まで学習し直す方法がファインチューニングで、学習済みの部分を固定して出口だけを学習する方法が特徴抽出です。
どちらを使えばよいですか?
まず特徴抽出で試し、成績が足りなければファインチューニングに進むのが安全です。データが少なく元の課題に近いなら特徴抽出、データがある程度あり違いが大きいならファインチューニングが目安です。
ChatGPTのようなLLMでもファインチューニングはできますか?
できます。大量の文章で事前学習したモデルを、特定の目的に合わせて追加で学習させます。全体を学習させると費用がかかるので、LoRAのように学習する量を減らす方法もよく使われます。
RAGとファインチューニングはどう選べばよいですか?
社内の規程やよく変わる情報を答えさせたいならRAG、答え方の形や特定の作業のくせを覚えさせたいならファインチューニングが目安です。RAGはモデルを変えずに資料を渡し、根拠も示しやすい方法です。
データはどれくらい必要ですか?
課題や元のモデルとの近さで大きく変わるため、決まった数はありません。特徴抽出なら比較的少ないデータから始められます。検証用のデータで成績を確かめながら、足りなければ集め足してください。
この記事を共有する
商品情報の提供:Supported by Rakuten Developers
出典と、この記事について
公式資料や、記事で参照した発表・報道をまとめています。仕様や料金は、利用する前に最新の案内をご確認ください。
- TensorFlow:Transfer learning and fine-tuning(新しいタブで開きます)
- Hu ほか「LoRA: Low-Rank Adaptation of Large Language Models」(2021年)(新しいタブで開きます)
- Lewis ほか「Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks」(2020年)(新しいタブで開きます)
- Hinton・Vinyals・Dean「Distilling the Knowledge in a Neural Network」(2015年)(新しいタブで開きます)
- 技術評論社:大規模言語モデル入門(目次)(新しいタブで開きます)
- オライリー・ジャパン:ゼロから作るDeep Learning ❻ LLM編(目次)(新しいタブで開きます)
確認した内容と条件は本文に記載しています。結果や使い勝手は、資料や環境によって異なります。編集方針を読む




ぜひコメントください