科目A-1 Unit 4 データ・AIの利活用 入門学習

科目A-1 入門学習
›
Unit 4 データ・AIの利活用
科目A-1 Unit 4(その他の分野)

データ・AIの利活用 入門学習

データマネジメント・データ品質・データ基盤・統計と可視化・AI利活用の原則・生成AIとAIエージェントの活用を学ぶ

📚 6章構成✏️ 確認テスト 7問⏱ 目安30分
シラバス対応:大分類2 データ・AIの利活用/中分類8〜10

データマネジメントの考え方

データドリブン経営は、データに基づいて意思決定する経営です。DIKWモデルはデータ(Data)→情報(Information)→知識(Knowledge)→知恵(Wisdom)の階層で、データが価値に変わる過程を表します。データは生成・保管・処理・活用・廃棄のライフサイクルで管理し、組織内で正とする情報源を一つに定めるSSOTの考え方が重要です。データガバナンスの基本行動は「評価・方針又は指示・監視」で、データマネジメントの機能にはデータモデリング・データ統合・データ品質管理・メタデータ管理・データセキュリティがあります。

データ品質とメタデータ

データ品質特性には正確性・完全性・一貫性・信憑性・機密性などがあります。品質の改善では、欠損値の補完・除外、外れ値や異常値の修正・削除、重複の排除、表記ゆれの修正などのデータクレンジングを行い、入力チェックなどの予防措置で品質低下を防ぎます。

メタデータは「データについてのデータ」で、業務上の意味を表すビジネスメタデータ、テーブル定義などITに関するテクニカルメタデータ、処理履歴など運用に関するオペレーショナルメタデータに分類されます。どこにどんなデータがあるかを探せるデータカタログや、業務用語を定義したビジネスグロッサリーも押さえましょう。

データ基盤

データレイクは様々な形式のデータをそのまま蓄積する場所、データウェアハウス(DWH)は分析用に統合・整理したデータの保管場所、データマートは特定の部門や目的向けに切り出したデータです。両者の利点を併せ持つのがレイクハウスです。DWHの設計では、事実を表すファクトテーブルを分析軸のディメンションテーブルが囲むスタースキーマがよく使われます。データを読み出すときに構造を当てはめるスキーマオンリードと、書き込むときに当てはめるスキーマオンライト、変換してから格納するETLと格納してから変換するELTを区別します。

統計的手法と可視化・業務分析

統計では代表値・標準偏差・正規分布・回帰分析・主成分分析が基本です。2つの変数に相関があっても、第三の要因によって生じているだけの場合を擬似相関といいます。仮説検定では、帰無仮説が正しいのに棄却してしまう第1種の誤りと、誤っているのに棄却しない第2種の誤りを区別します。同時に購入される商品の関係を探すアソシエーション分析ではリフト値を使います。

可視化では、比較・構成・分布・推移・相関などの目的に応じてグラフを選び、分布の把握には箱ひげ図を使います。業務分析では線形計画法、QC七つ道具・新QC七つ道具、需要予測(移動平均法・指数平滑法など)、専門家の意見を繰り返し集約するデルファイ法、乱数を使って試行を繰り返すモンテカルロ法が範囲です。

AI利活用の原則と政策

人間中心のAI社会原則は、人間中心・教育やリテラシー・プライバシー確保・セキュリティ確保・公正競争確保・公平性、説明責任及び透明性・イノベーションの7つの原則からなります。事業者向けには、AIの開発者・提供者・利用者それぞれの取り組みを示したAI事業者ガイドラインがあります。AIを組織的に管理するための規格がAIマネジメントシステム(ISO/IEC 42001)で、AIの安全性の評価手法などを検討する機関としてAIセーフティ・インスティテュート(AISI)があります。

識別AI・生成AI・AIエージェントの活用

識別AIは認識・自動化・異常検知・予測(教師あり学習)・グルーピング(教師なし学習)などに活用されます。生成AIでは、出力のランダム性を調整するTemperature(値が高いほど多様な出力になる)やTop-p・Top-k、外部の知識を検索して回答に反映するRAG、プロンプトエンジニアリング、AIの振る舞いを前提として指示するシステムプロンプト、機密データを外部に送らないためのローカルLLMの検討が範囲です。

AIエージェントは目的に向けて自ら計画し、ツールを使って行動するAIです。特性として適応性・積極性・目的の複雑性・環境の複雑性・自律性が挙げられます。自律性が高いほど人間の関与のあり方の設計が重要になり、安全性・倫理・法令順守に配慮したガードレールを設けます。

重要ポイントまとめ
  • DIKW:データ→情報→知識→知恵
  • データガバナンスの基本行動:評価・方針又は指示・監視
  • メタデータ:ビジネス・テクニカル・オペレーショナルの3種類
  • ETL=変換してから格納、ELT=格納してから変換
  • 第1種の誤り=正しい帰無仮説を棄却、第2種の誤り=誤った帰無仮説を棄却しない
  • Temperatureが高いほど出力は多様に、RAG=外部知識を検索して回答に反映
  • AIエージェントにはガードレールと人間の関与の設計が必要
✏️ 確認テスト(全7問)
問 1
DIKWモデルの階層を、下位から順に正しく並べたものはどれか。
ア. 情報→データ→知識→知恵
最も下位にあるのは加工前のデータです。
イ. データ→情報→知識→知恵
正解です。データに意味付けしたものが情報、情報を体系化したものが知識、知識を適切に使う判断力が知恵です。
ウ. データ→知識→情報→知恵
情報と知識の順序が逆です。
エ. 知恵→知識→情報→データ
上位から並べた順です。
選択肢をクリックすると正誤と解説が表示されます
問 2
仮説検定における第1種の誤りの説明として正しいものはどれか。
ア. 帰無仮説が誤っているにもかかわらず、帰無仮説を棄却しない
第2種の誤りの説明です。
イ. 標本の抽出に偏りがあり、母集団を代表していない
標本抽出のバイアスの説明です。
ウ. 帰無仮説が正しいにもかかわらず、帰無仮説を棄却してしまう
正解です。「効果がないのに効果があると判断する」誤りで、有意水準はこの誤りが起きる確率の上限です。
エ. 2つの変数の間に因果関係がないのに相関が見られる
擬似相関の説明です。
選択肢をクリックすると正誤と解説が表示されます
問 3
ELTの特徴として適切なものはどれか。
ア. データを抽出し、変換してからDWHに格納する
ETLの説明です。
イ. データを移動せずに、複数のデータソースを仮想的に統合して参照する
データ仮想化の説明です。
ウ. データを書き込む時点でスキーマに合わせて構造化する
スキーマオンライトの説明です。
エ. データを抽出し、まず格納してから格納先の処理能力を使って変換する
正解です。クラウドDWHなど処理能力の高い格納先で変換するため、元のデータを残したまま柔軟に加工できます。
選択肢をクリックすると正誤と解説が表示されます
問 4
生成AIのパラメータTemperatureを高く設定したときの出力の傾向として適切なものはどれか。
ア. 確率の低い語も選ばれやすくなり、多様でランダム性の高い出力になる
正解です。アイデア出しには高め、正確さが求められる回答には低めの設定が向いています。
イ. 毎回ほぼ同じ、確率の高い語が選ばれやすくなる
Temperatureを低くしたときの傾向です。
ウ. 出力できる文章の最大長が長くなる
出力長は最大トークン数などで制御します。
エ. 外部の文書を検索して回答に反映するようになる
RAGの説明で、Temperatureとは関係ありません。
選択肢をクリックすると正誤と解説が表示されます
問 5
RAG(検索拡張生成)を活用する主な目的として適切なものはどれか。
ア. 大規模言語モデルのパラメータ数を削減して高速化する
量子化や蒸留など、モデルの軽量化の目的です。
イ. 社内文書などの外部知識を検索して回答に反映し、最新かつ根拠のある回答を得る
正解です。モデルを再学習しなくても知識を追加できますが、参照データへのアクセス制御が必要です。
ウ. 人間の評価をもとにモデルの出力を好ましい方向へ調整する
RLHFの説明です。
エ. 画像や音声など複数の種類のデータを同時に扱う
マルチモーダルAIの説明です。
選択肢をクリックすると正誤と解説が表示されます
問 6
テクニカルメタデータの例として最も適切なものはどれか。
ア. 「顧客」という業務用語の定義
業務上の意味を表すビジネスメタデータです。
イ. 夜間バッチの実行日時と処理件数の記録
システム運用に関するオペレーショナルメタデータです。
ウ. テーブルの列名・データ型・桁数の定義
正解です。テクニカルメタデータはデータベースの構造などITに関する情報です。
エ. データの利用申請を承認する担当部署
データガバナンスの運用ルールに関する情報で、テクニカルメタデータの例としては適切ではありません。
選択肢をクリックすると正誤と解説が表示されます
問 7
「アイスクリームの売上が多い日は水難事故も多い」という相関について、気温という第三の要因が両方に影響していると考えられる場合、このような相関を何というか。
ア. 因果関係
一方が他方の原因になっている関係ではないため、因果関係とはいえません。
イ. 多重共線性
回帰分析で説明変数どうしが強く相関している状態のことです。
ウ. 自己相関
時系列データで、過去の自分自身の値との相関のことです。
エ. 擬似相関
正解です。相関があっても因果関係があるとは限らないため、データ分析では第三の要因を確認することが重要です。
選択肢をクリックすると正誤と解説が表示されます

演習問題で理解を定着させよう

科目A-1(共通知識)の演習問題で実践力を高めましょう

科目A-1 演習問題を解く →