AI・機械学習領域 入門学習

TOP › システム区分 › 入門学習ガイド › Unit 4 AI・機械学習領域
システム区分 Unit 4

AI・機械学習領域 入門学習

機械学習基礎・LLM・RAG・MLOps・AIシステムのリスクを体系的に学ぶ

📚 5章構成✏️ 確認テスト 3問⏱ 目安25分

機械学習の種別と主要アルゴリズム

機械学習は大きく3種類に分類されます。教師あり学習(Supervised Learning)は入力と正解ラベルのペアで訓練し、予測・分類を行います(例:線形回帰・決定木・SVM・ランダムフォレスト)。主な評価指標は回帰ではRMSE(二乗平均平方根誤差)、分類ではAccuracy・Precision・Recall・F1スコア、そしてROC-AUCです。

教師なし学習(Unsupervised Learning)はラベルなしデータからパターンを発見します(クラスタリング:k-means、次元削減:PCA)。強化学習(Reinforcement Learning)はエージェントが環境と相互作用しながら累積報酬を最大化する方策を学習します(例:ゲームAI、自動運転)。

過学習と正則化
  • 過学習(Overfitting):訓練データに特化しすぎて汎化性能が低下
  • L1正則化(Lasso):不要な特徴量の係数をゼロにして特徴選択
  • L2正則化(Ridge):係数を小さく抑えて滑らかなモデルを生成
  • ドロップアウト:ニューラルネットワークでランダムにノードを無効化
  • クロスバリデーション:k-fold等でモデル汎化性能を推定

ニューラルネットワークと深層学習

深層学習(Deep Learning)は多層ニューラルネットワークを使った機械学習の一手法です。CNN(Convolutional Neural Network)は画像認識に特化し、畳み込み層で局所的な特徴(エッジ・形状)を抽出します。RNN/LSTMは時系列・シーケンスデータに対応します。

Transformerは2017年に提案されたアーキテクチャで、Self-Attention機構によりシーケンス全体の依存関係を並列処理できます。GPT系(生成型)とBERT系(エンコーダ型)があり、自然言語処理の性能を飛躍的に向上させました。事前学習(Pre-training)とファインチューニング(Fine-tuning)の組み合わせで少データでも高性能を発揮します。

主な評価指標(NLP系モデル)
  • BLEU:機械翻訳の精度評価(n-gramマッチ率)
  • ROUGE:要約の評価(再現率重視)
  • Perplexity:言語モデルの予測難易度(低いほど良い)
  • BenchMark:MMLU/HumanEvalなど能力横断評価

大規模言語モデル(LLM)とRAG

LLM(Large Language Model)は数十億以上のパラメータを持つTransformerベースの言語モデルです(GPT-4、Claude、Gemini等)。プロンプトエンジニアリングは適切な指示文でLLMの出力を制御する技術で、Zero-shot(例なし)、Few-shot(少数例提示)、Chain-of-Thought(段階的思考誘導)などの手法があります。

RAG(Retrieval-Augmented Generation)は外部の知識ベース(ベクターDB)から関連文書を検索し、LLMの生成に組み込む手法です。LLMの学習データカットオフ問題・ハルシネーション(誤った事実の生成)を緩和できます。ベクターDBにはPinecone・Chroma・pgvector等が使われ、文書のエンベディング(意味表現ベクトル)による類似検索を行います。

LLMのカスタマイズ手法
  • プロンプトエンジニアリング:追加学習不要・コスト低
  • RAG:外部知識の動的統合・リアルタイム情報対応
  • ファインチューニング:特定ドメインデータで追加学習・コスト高
  • RLHF(人間のフィードバックからの強化学習):有害出力の抑制

MLOps

MLOps(Machine Learning Operations)は機械学習モデルの開発・デプロイ・運用を継続的に改善する実践です。DevOpsの原則をMLシステムに適用したもので、特徴量管理・実験管理・モデルレジストリ・モニタリングのサイクルを自動化します。

MLパイプラインは①データ収集・前処理、②特徴量エンジニアリング、③モデル学習、④評価・バリデーション、⑤デプロイ(A/Bテスト・カナリアデプロイ)、⑥本番モニタリングで構成されます。データドリフト(入力データの分布変化)やコンセプトドリフト(目的変数の関係変化)を検知して再学習をトリガーする仕組みが重要です。

主要MLOpsツール
  • MLflow:実験管理・モデルレジストリ・デプロイ
  • Kubeflow:Kubernetes上のMLパイプライン管理
  • Feature Store(Feast/Hopsworks):特徴量の一元管理・再利用
  • Evidently AI/Seldon:本番モデルのデータドリフト・品質監視

AIシステムのリスクとガバナンス

AIリスクには技術的リスクと社会的リスクがあります。技術的リスクとして、敵対的攻撃(Adversarial Attack)は入力データに微小な摂動を加えてモデルを誤認識させます。モデル反転攻撃(Model Inversion)は出力から訓練データを復元しプライバシーを侵害します。メンバーシップ推論攻撃は特定データが訓練セットに含まれるか推定します。

社会的リスクとしてアルゴリズムバイアス(訓練データの偏りが差別的判断を引き起こす)があります。NIST AI RMF(Risk Management Framework)はAIシステムのリスクをGovernance・Map・Measure・Manageの4機能で管理するフレームワークです。EUのAI法(AI Act)はリスクベースで規制し、高リスクAIには適合性評価が必要です。

AI倫理・ガバナンスの原則
  • 説明可能性(Explainability):AIの判断根拠を人間が理解できること
  • 公平性(Fairness):性別・人種等による差別的判断の排除
  • 透明性(Transparency):AIの学習データ・アルゴリズムの開示
  • アカウンタビリティ:AI判断に対する責任の所在明確化
  • プライバシー保護:個人データの最小利用・匿名化
✏️ 確認テスト(全3問)
問 1
機械学習における「過学習(Overfitting)」の説明として最も適切なものはどれか。
ア. 学習データが不足しているためにモデルの精度が訓練・検証両方で低い状態
これはアンダーフィッティング(過小適合)の説明です。データ不足や過度にシンプルなモデルが原因です。
イ. モデルが訓練データに特化しすぎて未知データへの予測精度が低下した状態
正解です。過学習は訓練データのノイズや外れ値まで学習した結果、汎化性能が低下した状態です。L1/L2正則化・ドロップアウト・Early Stoppingで防止します。
ウ. 訓練データと検証データのラベルが混在してモデルが正しく評価できない状態
データリークやラベルの混在は過学習とは異なる問題です。
エ. モデルのパラメータ数が少なすぎてデータの複雑なパターンを表現できない状態
パラメータ不足は表現力不足(アンダーフィッティング)の原因です。
選択肢をクリックすると正誤と解説が表示されます
問 2
RAG(Retrieval-Augmented Generation)の主な目的として最も適切なものはどれか。
ア. LLMのパラメータを特定ドメインのデータで再学習することで専門知識を強化する
これはファインチューニングの説明です。RAGはモデルを再学習せずに外部知識を統合します。
イ. 外部知識ベースから関連文書を検索しLLMの生成に組み込むことでハルシネーションを緩和する
正解です。RAGはベクターDBで意味検索した関連文書をプロンプトに組み込み、LLMが学習時に持たない最新情報や専門知識を活用できます。モデルの再学習が不要で導入コストが低いのも特徴です。
ウ. 複数のLLMを並列実行してアンサンブル学習で精度を向上させる手法
LLMのアンサンブルは異なる手法で、RAGはリトリーバルと生成の組み合わせを指します。
エ. 人間のフィードバックを報酬として強化学習でLLMの有害出力を抑制する手法
これはRLHF(Reinforcement Learning from Human Feedback)の説明です。
選択肢をクリックすると正誤と解説が表示されます
問 3
MLOpsにおける「データドリフト」の説明として最も適切なものはどれか。
ア. 本番環境に投入するモデルのバージョンを管理するためのレジストリ機能
モデルバージョン管理はモデルレジストリ(MLflowなど)の機能です。
イ. モデルの学習データや推論結果が大量になりストレージが不足する問題
ストレージ問題はデータドリフトとは別の運用課題です。
ウ. 本番環境での入力データの統計的分布が学習時と乖離し、モデル精度が低下する現象
正解です。データドリフトは入力データのパターン変化(例:ユーザー行動の変化・季節性)により、学習済みモデルの予測精度が徐々に低下する現象です。継続的モニタリングと定期的な再学習で対応します。
エ. 分散処理でのデータシャーディングによって生じる処理速度の低下
シャーディングの性能問題はデータドリフトではありません。
選択肢をクリックすると正誤と解説が表示されます