データマネジメント試験の用語と解説
新しい試験(2027〜)・シラバス案から。183 語のうち 101〜150 語目です。答えを隠して、問いから答えを思い出してから読むと、覚えやすくなります。
この問題集をタイピングで解く
最頻値さいひんち|もーど
問いデータの中で、いちばん多く現れる値を何というか(漢字3文字で)。
最も多く現れる値です。度数分布表では、度数が最大の階級の値(階級値)になります。
【別解】モード
分散ぶんさん
問い各データと平均値との差を2乗し、それらを平均した値を何というか(漢字2文字で)。
散らばりが大きいほど値が大きくなります。2 乗しているため、単位は元のデータと異なります。
標準偏差ひょうじゅんへんさ
問い分散の正の平方根で、元のデータと同じ単位で散らばりを表す指標を何というか。
記号は σ(シグマ)。分散の平方根をとることで単位が元のデータと同じになります。
四分位範囲しぶんいはんい|しぶんいすうはんい
問い第3四分位数から第1四分位数を引いた値で、真ん中50%のデータの広がりを表すものを何というか。
箱ひげ図の「箱」の長さにあたり、外れ値の影響を受けにくい散らばりの指標です。
【別解】四分位数範囲
偏差値へんさち
問い平均が50、標準偏差が10になるように点数を換算した値を何というか。
平均点ちょうどなら 50 になります。テストの難しさが違っても集団内の位置を比べられます。
度数分布表どすうぶんぷひょう
問いデータをいくつかの区間(階級)に分け、それぞれに入るデータの個数をまとめた表を何というか。
各階級に入る個数を「度数」と呼びます。
【関連】これを柱状のグラフにしたものがヒストグラムです。
相関係数そうかんけいすう
問い2つの量的なデータの直線的な関係の強さを、−1から1までの数で表したものを何というか。
1 に近いほど正の相関、−1 に近いほど負の相関、0 付近は直線的な関係が弱いことを表します。
正の相関せいのそうかん
問い一方の値が大きいほど、もう一方の値も大きくなる傾向がある関係を何というか(「〜の相関」の形で)。
散布図で点が右上がりに並ぶ関係です。
【関連】右下がりなら負の相関です。
因果関係いんがかんけい
問い「アイスが売れる日は水難事故が多い」のように一緒に動くことと区別される、一方が原因で他方が結果となる関係を何というか(漢字4文字で)。
相関があっても因果関係があるとは限りません。気温のような別の原因が隠れていることがあります。
疑似相関ぎじそうかん|みかけのそうかん|みせかけのそうかん
問い2つの変数の間に直接の因果は無いのに、第3の変数の影響で相関があるように見えることを何というか。
隠れた共通の原因(交絡因子)によって生じる見かけの相関です。
【別解】見かけの相関/見せかけの相関
交絡因子こうらくいんし|こうらくへんすう|こうらくようい|こうらくよういん
問い原因と考える変数と結果の変数の両方に影響し、両者の関係をゆがめて見せてしまう第3の要因を何というか。
交絡因子があると疑似相関が生まれ、交絡バイアスの原因になります。
【別解】交絡変数/交絡要因
回帰分析かいきぶんせき
問い予測したい変数を、ほかの変数を使った式で表し、その関係を調べたり予測したりする分析手法を何というか。
説明変数が 1 つなら単回帰、2 つ以上なら重回帰と呼びます。
重回帰分析じゅうかいきぶんせき
問い回帰分析のうち、予測に使う変数(説明変数)が2つ以上あるものを何というか。
「重」は「重ねる」の意味で、説明変数が 2 つ以上の回帰分析です。
【関連】説明変数が 1 つだけなら単回帰分析です。
目的変数もくてきへんすう|じゅうぞくへんすう|ひせつめいへんすう|おうとうへんすう
問い回帰分析で、予測したい側(結果の側)の変数を何というか(漢字4文字で)。
回帰分析で予測される(結果の)側の変数です。
【別解】従属変数/被説明変数/応答変数
【関連】予測に使う側は説明変数(独立変数)です。
説明変数せつめいへんすう|どくりつへんすう
問い回帰分析で、結果の変数を予測するために使う側の変数を何というか(漢字4文字で)。
目的変数を予測するために使う側の変数です。
【別解】独立変数
【関連】予測される側の目的変数と対で覚えておきましょう。
決定係数けっていけいすう
問い回帰分析で、回帰式がデータにどれだけ当てはまっているかを0から1の値で表す指標を何というか。
R²(アールにじょう)と書き、1 に近いほど回帰式がデータをよく説明していることを表します。
最小二乗法さいしょうにじょうほう|さいしょうじじょうほう
問い実際の値と予測値の差(残差)を2乗した合計が最も小さくなるように、回帰直線を求める方法を何というか。
残差をそのまま足すと正負が打ち消し合うため、2 乗してから合計し、それを最小にします。
【別解】最小自乗法
正規分布せいきぶんぷ|がうすぶんぷ
問い平均値を中心に左右対称で、つり鐘のような形をした代表的な確率分布を何というか。
平均を中心に左右対称なつり鐘形の分布で、身長や測定誤差など多くのデータがこの形に近くなります。
【別解】ガウス分布
約68%68
問い正規分布で、平均±1標準偏差の範囲に入るデータの割合は約何%か(整数で答える)。
±1σで約 68%、±2σで約 95%、±3σで約 99.7%。「68・95・99.7」と覚えておきましょう。
順列じゅんれつ
問い異なる n 個のものから r 個を取り出し、順番を考えて並べる並べ方を何というか(漢字2文字で)。
記号は nPr です。
【関連】順番を考えずに選ぶだけなら組合せ(nCr)です。
組合せくみあわせ
問い異なる n 個のものから、順番を考えずに r 個を選ぶ選び方を何というか(漢字とひらがなで)。
記号は nCr です。
【関連】並べる順番まで考えるのは順列(nPr)です。
母集団ぼしゅうだん
問い統計で、調べたい対象の全体を何というか(漢字3文字で)。
調べたい対象の全体で、推測統計では標本からその性質を推し量ります。
【関連】母集団から取り出した一部は標本(サンプル)です。
標本ひょうほん|さんぷる
問い統計で、母集団から調査のために取り出した一部のデータを何というか(漢字2文字で)。
標本の結果から母集団の性質を推し量るのが推測統計です。
【別解】サンプル
全数調査ぜんすうちょうさ|しっかいちょうさ
問い国勢調査のように、調べたい対象をひとつ残らずすべて調べる調査を何というか(漢字4文字で)。
対象をすべて調べる調査で、国勢調査が代表例です。
【別解】悉皆調査
【関連】一部だけを調べるのは標本調査です。
無作為抽出むさくいちゅうしゅつ|らんだむさんぷりんぐ
問い母集団から、どの要素も同じ確率で選ばれるように標本を選ぶ方法を何というか(漢字5文字で)。
どの要素も同じ確率で選ばれるようにする方法で、選び方が偏ると選択バイアスが生じます。
【別解】ランダムサンプリング
帰無仮説きむかせつ
問い仮説検定で、「差がない」「効果がない」のように、否定(棄却)されることを期待して立てる仮説を何というか。
「無に帰する」ことを期待して立てる仮説です。
【関連】棄却されたときに採用されるのは対立仮説です。
有意水準ゆういすいじゅん|きけんりつ
問い仮説検定で、帰無仮説を棄却するかどうかの基準となる確率(5%や1%がよく使われる)を何というか。
p 値がこれより小さければ「有意な差がある」と判断します。
【別解】危険率
p値pち|ぴーち|pあたい|ぴーあたい
問い帰無仮説が正しいとしたとき、実際に観測された結果かそれ以上に極端な結果が出る確率を何というか(英字1文字と漢字1文字で)。
p 値が有意水準より小さいと帰無仮説を棄却します。効果の大きさそのものを表すわけではありません。
第1種の誤りだい1しゅのあやまり|だいいっしゅのあやまり|だいいちしゅのあやまり
問い仮説検定で、帰無仮説が本当は正しいのに棄却してしまう誤りを何というか(「第○種の誤り」の形で、数字で)。
「あわてんぼうの誤り」とも呼ばれ、起きる確率は有意水準に等しくなります。
【関連】誤った帰無仮説を棄却できない誤りは第 2 種の誤りです。
選択バイアスせんたくばいあす|せれくしょんばいあす
問い調査対象の選び方が偏っていたために、結果が母集団の姿からずれてしまうバイアスを何というか(カタカナと漢字で)。
ネット調査でネットを使う人の意見ばかりが集まる、などが典型例です。
【別解】セレクションバイアス
情報バイアスじょうほうばいあす|そくていばいあす
問い統計的バイアスのうち、測定方法の誤りや回答者の記憶違いなど、集めた情報の不正確さによって生じるものを何というか。
測定方法の誤りや記憶違いなど、情報の不正確さによるバイアスです。
【別解】測定バイアス
【関連】選び方の偏りは選択バイアス、隠れた要因によるものは交絡バイアスです。
確証バイアスかくしょうばいあす
問い自分の考えや仮説に合う情報ばかりを集め、反対の情報を軽く見てしまう思い込みを何というか。
分析者がこれに陥ると、都合のよい結果だけを報告してしまうおそれがあります。
ハロー効果はろーこうか|こうはいこうか
問い人や物の目立つ特徴に引きずられて、ほかの特徴まで高く(または低く)評価してしまう心理を何というか。
ハローは「後光」。目立つ特徴に引きずられて全体の評価がゆがむ認知バイアスの一つです。
【別解】後光効果
量的データりょうてきでーた|ていりょうでーた
問い身長や売上のように、数値で表され、足し算や平均に意味があるデータを何というか(漢字2文字+「データ」)。
数値で表され、足し算や平均に意味があるデータです。
【別解】定量データ
【関連】血液型のような分類のデータは質的データです。
質的データしつてきでーた|ていせいでーた
問い性別や血液型のように、分類や区別を表すデータを何というか(漢字2文字+「データ」)。
分類や区別を表すデータで、数字で記録していても平均に意味がなければこちらに入ります。
【別解】定性データ
名義尺度めいぎしゃくど
問い測定の尺度のうち、背番号や血液型のように、区別するためだけに使うものを何というか。
背番号のように区別のためだけに使う尺度で、大小や計算には意味がありません。
【関連】尺度は名義→順序→間隔→比例の順に、できる計算が増えていきます。
間隔尺度かんかくしゃくど
問い測定の尺度のうち、摂氏の気温のように差には意味があるが、0が「何も無い」を意味しないものを何というか。
差には意味がありますが、20℃が 10℃の 2 倍暑いとは言えません。
【関連】比にも意味があるのは比例尺度です。
1次データ1じでーた|いちじでーた
問い分析する人が、自分の目的のために調査や実験で自ら集めたデータを何というか(数字を使って)。
目的に合ったデータが得られる反面、集める手間がかかります。
【関連】他者が集めたものを使うのは 2 次データです。
2次データ2じでーた|にじでーた
問い官公庁の統計など、ほかの人や組織が別の目的で集めたデータを利用する場合、そのデータを何というか(数字を使って)。
手軽に使えますが、集めた目的や定義が自分の分析と合うかを確かめる必要があります。
構造化データこうぞうかでーた
問い表計算ソフトの表のように、行と列で項目が決まった形に整理されたデータを何というか。
関係データベースに格納しやすいデータです。
【関連】文章・画像などは非構造化データです。
非構造化データひこうぞうかでーた
問い文章・画像・音声・動画のように、決まった表の形になっていないデータを何というか。
世の中のデータの大部分はこちらで、AI の発達により分析しやすくなりました。
半構造化データはんこうぞうかでーた
問いJSON や XML のように、タグやキーで一定の構造はもつが、表の形には収まりきらないデータを何というか。
構造化データと非構造化データの中間で、Web API の応答によく使われます。
時系列データじけいれつでーた
問い毎日の気温や月ごとの売上のように、時間の順に記録したデータを何というか。
季節による変動(周期性)や長期の傾向(トレンド)を読み取るのに使います。
GISgis|じーあいえす|ちりじょうほうしすてむ|geographic information system
問い地図上の位置と、その場所の属性の情報を重ね合わせて分析・表示する仕組みを、英字3文字で何というか。
地理情報システムの略で、ハザードマップや出店計画に使われます。
【別解】地理情報システム/Geographic Information System
シェープファイルしぇーぷふぁいる|しぇいぷふぁいる
問いGIS で、点・線・面の図形と属性をまとめて保存する代表的なファイル形式(拡張子 .shp など)を何というか。
米国 Esri 社が作った形式で、複数のファイルの組で 1 つのデータになります。
クローリングくろーりんぐ
問いプログラムが Web ページのリンクを次々にたどって巡回し、ページを集めることを何というか。
リンクをたどってページを集める処理です。
【関連】ページから必要な情報を抜き出すのはスクレイピングです。
スクレイピングすくれいぴんぐ|うぇぶすくれいぴんぐ
問いWeb ページの HTML から、価格や見出しなど必要な情報だけをプログラムで抜き出すことを何というか。
サイトの利用規約を確認し、相手のサーバに負荷をかけないよう注意が必要です。
【別解】Webスクレイピング
ポーリングぽーりんぐ
問い新しいデータがあるかどうかを、一定の間隔で相手のシステムに問い合わせて確かめる方式を何というか。
こちらから定期的に問い合わせる方式です。
【関連】相手から知らせてもらう方式はプッシュ型です。
バッチ処理ばっちしょり|いっかつしょり
問い一定期間分のデータをためておき、夜間などにまとめて一度に処理する方式を何というか(カタカナと漢字で)。
ためたデータをまとめて処理する方式です。
【別解】一括処理
【関連】データが来るたびにすぐ処理するのはリアルタイム処理です。
アノテーションあのてーしょん|らべりんぐ|たぐづけ
問い機械学習の学習データを作るために、画像やテキストに「犬」「ネコ」などの正解の情報(ラベル)を付ける作業を何というか。
「注釈」の意味で、作業の質がそのまま AI の精度に影響します。
【別解】ラベリング/タグ付け