IT用語を超やさしく理解する

度数分布・ヒストグラム・箱ひげ図

別名: 度数分布表 / 度数分布 / ヒストグラム / 箱ひげ図 / 四分位数 / 四分位範囲 / frequency distribution / histogram / box plot

30秒で思い出す

データがどのあたりに集まり、どれくらい広がっているかを見る方法として、度数分布表・ヒストグラム・箱ひげ図があります。

  • 度数分布表: 値をいくつかの区間に分け、各区間に何個あるか数える
  • ヒストグラム: 度数分布を棒の高さで表し、分布の形を見る
  • 箱ひげ図: 中央値や四分位数を使い、データの中心と広がりをコンパクトに比べる

同じデータでも、表だけでなく図にすると「どこに集まるか」「偏りがあるか」「広がりが大きいか」を見つけやすくなります。

超やさしく理解

クラスの20人の身長を調べたとします。1人ずつ数字を並べるだけでは、どのくらいの身長の人が多いか、ひと目では分かりにくそうです。

そこで、近い身長の人をグループに分けて数えます。

  • 120〜129 cm:2人
  • 130〜139 cm:5人
  • 140〜149 cm:8人
  • 150〜159 cm:5人

これなら、140〜149 cmのグループが一番多いと分かります。

このように、数字をいくつかの範囲に分けて、それぞれ何人いるかを整理するのが「度数分布」の基本です。グループごとの人数をまとめた表を「度数分布表」と呼びます。

人数を棒の高さで表せば、どこに多く集まっているかを目で確かめやすくなります。これが「ヒストグラム」です。

また、もとの20人の身長を小さい順に並べ、真ん中の値や広がりを箱と線で表すと、別のクラスとも比べやすくなります。これが「箱ひげ図」です。

度数分布表

データをいくつかの区間に分け、各区間に含まれるデータの個数を整理した表を度数分布表と呼びます。

階級

データを分けた区間を階級と呼びます。

例:

0〜9 ms
10〜19 ms
20〜29 ms
30〜39 ms

度数

各階級に入るデータの個数を度数と呼びます。

階級       度数
0〜9       2
10〜19     5
20〜29     8
30〜39     5

この例では、20〜29 msの階級の度数が8で最も大きく、データがこの付近に多く集まっていると読めます。

階級の幅に注意する

度数分布を比べるときは、階級の区切り方も確認します。

たとえば、

0〜9
10〜19
20〜29

のように同じ幅で区切っていれば、棒の高さを比較しやすくなります。

一方で、階級幅が違う表を単純に度数だけで比べると、分布の見え方を誤ることがあります。

まずは、どの範囲を1つの階級としてまとめているかを確認します。

ヒストグラム

ヒストグラムは、度数分布を棒の高さで表したグラフです。

横軸に階級、縦軸に度数などを取ります。

ヒストグラムを見ると、

  • どこにデータが多いか
  • 左右にどれくらい広がっているか
  • 一方へ偏っていないか
  • 山が1つか複数あるか

などを視覚的に確認できます。

棒グラフとの違い

ヒストグラムと棒グラフは見た目が似ていますが、目的が違います。

ヒストグラム

連続的な数値データを階級に分け、分布の形を見るために使います。

棒グラフ

製品A・製品B・製品Cのようなカテゴリごとの数量を比べるために使います。

ヒストグラムでは、隣り合う階級が連続した数値範囲を表します。

「棒があるグラフだから全部ヒストグラム」と考えないことが大切です。

箱ひげ図

箱ひげ図は、データを小さい順に並べたときの位置関係を使い、中心と広がりを表す図です。

基本的な読み方では、次の値や位置関係に注目します。

  • 第1四分位数 Q1
  • 中央値 Q2
  • 第3四分位数 Q3
  • ひげが示す範囲
  • 必要に応じて別に示される外れ値

実際の箱ひげ図では、箱の部分がQ1からQ3までを表し、箱の中の線が中央値を表します。ひげの端を最小値・最大値とする表し方もありますが、外れ値を分けて表示する方式では、ひげの外側に値が存在することがあります。

四分位数

データを小さい順に並べ、だいたい4等分する位置を四分位数と呼びます。

  • Q1: 下から約25%の位置
  • Q2: 約50%の位置 = 中央値
  • Q3: 約75%の位置

Q1からQ3までには、中央付近の約50%のデータが入ります。

四分位範囲

Q3とQ1の差を**四分位範囲(IQR)**と呼びます。

IQR = Q3 - Q1

たとえば、

Q1 = 20
Q3 = 40

なら、

IQR = 40 - 20 = 20

です。

IQRが小さいほど中央50%のデータが狭い範囲に集まり、IQRが大きいほど中央50%が広く散らばっている、と読み取れます。

2つの箱ひげ図を比べる

次の2つのデータを考えます。

A: Q1=20, 中央値=30, Q3=40
B: Q1=25, 中央値=30, Q3=35

中央値はどちらも30です。

一方、IQRは、

A: 40 - 20 = 20
B: 35 - 25 = 10

なので、Bの方が中央50%のデータが狭い範囲に集まっています。

箱ひげ図では、平均値だけでは見えにくいデータの広がりの違いも比較できます。

外れ値はどう表す?

箱ひげ図では、一般に他の値から大きく離れたデータを、ひげの外側へ点として示すことがあります。

ただし、外れ値の判定方法にはルールが必要です。

代表的な方法ではIQRを使いますが、このKnowledgeでは判定式そのものの暗記より、

「箱ひげ図では、中心・広がりに加えて、離れた値も把握しやすい」

という読み方を優先します。

どの方法を使う?

数を区間ごとに整理したい

→ 度数分布表

分布の形を視覚的に見たい

→ ヒストグラム

複数のデータ群の中心と広がりをコンパクトに比較したい

→ 箱ひげ図

目的に合わせて使い分けます。

どこで使う?

ITでは、たとえば次のようなデータを分析するときに使えます。

  • API応答時間
  • CPU使用率
  • メモリ使用量
  • 通信遅延
  • 障害から復旧までの時間
  • 1日あたりの問い合わせ件数

大量の測定値をそのまま眺めるより、分布として整理すると異常な偏りやばらつきに気付きやすくなります。

よくある勘違い

度数が一番多い階級に、平均値が必ず入る?

必ずしもそうではありません。

度数分布表は各階級に何個あるかをまとめたもので、平均値はデータ全体を使って計算する代表値です。

平均値の詳しい扱いは後続の代表値Knowledgeで学びます。

ヒストグラムと棒グラフは同じ?

違います。

ヒストグラムは数値データの分布、棒グラフはカテゴリ間の数量比較に使うのが基本です。

箱が短いほど、データ全部の範囲が狭い?

箱が表すのは主にQ1からQ3まで、つまり中央50%の広がりです。

全体の最小値・最大値や外れ値は、箱とは別に確認します。

箱ひげ図だけで分布の細かい形まで分かる?

分かりません。

箱ひげ図は中心や広がりを簡潔に比較するのに向いていますが、山の数や細かな形を見るにはヒストグラムなども役立ちます。

このKnowledgeで扱わないこと

ここでは、度数分布表・ヒストグラム・箱ひげ図を使って分布を整理し、基本的な特徴を読み取る方法を扱います。

次は後続Knowledgeへ分けます。

  • 平均値 / 中央値 / 最頻値の詳しい使い分け
  • 分散 / 標準偏差の計算
  • 歪度 / 尖度の詳しい解釈
  • 相関係数
  • 回帰分析
  • 推定
  • 仮説検定

ここまで分かればOK

  • 階級と度数の意味を説明できる
  • 度数分布表からデータが多い階級を読み取れる
  • ヒストグラムが分布の形を見る図だと説明できる
  • 箱ひげ図のQ1・中央値・Q3の位置付けを説明できる
  • IQR = Q3 - Q1で中央50%の広がりを比較できる
  • 目的に応じて度数分布表・ヒストグラム・箱ひげ図を使い分けられる

資格との関係

関連するIT用語

次に読む

理解できたか確認しよう

答えを選んで、なぜそうなるのかまで確認できます。

確認問題 1

箱ひげ図の中央50%の広がりを比べる

処理時間の箱ひげ図を比較します。システムAはQ1=20 ms、中央値=30 ms、Q3=40 msです。システムBはQ1=25 ms、中央値=30 ms、Q3=35 msです。

中央50%の処理時間が、より狭い範囲に集まっているのはどちらですか?

回答を1つ選んでください

確認問題 2

度数分布表から最も多い階級を読む

API応答時間20件を、0〜9 ms: 2件、10〜19 ms: 5件、20〜29 ms: 8件、30〜39 ms: 5件の度数分布表に整理しました。

データが最も多く含まれる階級はどれですか?

回答を1つ選んでください