情報処理論 1987...2002年度講義資料
[Syllabus],
[Prev],
[Next],
[Text & references]
- 統計データの読み方(Excelによる統計解析)
これまでは,時系列データと横断面データを素材とし,Excelを利用してこれらの基本的な読み方を説明してきた。
そこでは,表作成,グラフ作成,関数,データベースなどの機能を利用することによって,高校レベルの数学の知識さえ使わずに,データから情報を読み取る方法を学べることを示してきた。
また,このような直感的な見方の大切さを指摘し,Excelが表示する結果を自分自身で確認することを強調してきた。
しかしながら,本格的にデータを分析し,データに潜む情報(規則性と予測性)を引き出すためには,統計学(記述統計と推測統計)に関する基本的な知識が必要になる。
記述統計では
本章では,データの収集とその集計・整理作業を中心とする記述統計を取り扱う。作業の中心は、平均値や標準偏差などの「分布の特性値」を求めたり、ヒストグラムや散布図などのグラフ化によって、データの分類や層別を行うことである。このような基本的な統計分析について,Excelの分析ツールを利用して説明する。
今年は,シラバスにあるように2つの教科書の該当する章・節を教材とする。必要なデータのうち,入力に時間がかかるものはこのページからダウンロードできるようにしてある。
- 1 統計処理の基本
- データの種類
- 量的データと質的データ
- 質的データは、統計処理の準備として、コード化して量的データに変換しておく必要がある。
- 変量と変数
- 2種類以上の変量を同時に扱う場合を多変量データという。
- 離散量データと連続量データ
- 統計的推測
- 母集団と標本(サンプル):対象とする集団全体を母集団、母集団の性質を推測するために無作為(ランダム)に抽出した一部分を標本(サンプル)という。
- 区間推定と点推定:
- 2 Excelによる基本統計
- 基本統計量
- データの代表値
- 平均値: AVERAGE()関数
- 中央値(メジアン): MEDIAN()関数(教科書5章p.74-75)
- 最頻値(モード): MODE()関数 (教科書5章p.73)
- データのバラつき度合
- 分散: VAR(), VARP()関数("P"は母集団を対象とする場合)
- 標準偏差: STDEV(), STDEVP()関数
- 不偏分散: VAR関数( = ��j{(平均値)-(データj)}2/(データの自由度), データの自由度とはデータの個数‐1のこと)
- データの分布形
- 尖度(センド): KURT()関数(度数分布が、裾を長く引いて中央がとがった形であれば尖度は大きくなり、中央が平らで両端が急に落ちる形のとき値は小さくなる)
- 歪度(ワイド): SKEW()関数(度数分布が左右対称であれば値は0となる。平均値の左に(右に)裾を引いていれば正の値(負の値)になる。)
- その他
- 最大値、最小値、データの範囲
- データの個数
【例題1】
まずは、Excelの「統計関数」を使って、基本統計量を求めてみよう。データはある会社の新入社員のうち、男子25人分の身長と体重の測定値である。( Data: d-newmen.csv )
たとえば、身長データの分散と標準偏差を求めるには8行目(セルG8)に関数「=VAR(B5:B29)」と9行目に関数「=STDEV(B5:B29)」を入力する。結果はそれぞれ「28.17333」と「5.307856」となる。
- 分析ツールの利用
分析ツールは、Excelの標準ツールには含まれないアドイン関数である。[ツール]メニューを開き、[アドインの登録と管理]で分析ツールを使えるように設定しておく必要がある。
- 基本統計量ツール
【例題2】
上と同じ身長データに対してExcelの基本統計量ツールを適用してみよう。 基本統計量ツールの実行結果を【例題1】と比べてみる。また、身長と体重のデータを一度に選択して実行してみよう。基本統計量ツールは、選択範囲のデータに対して、約16種類の基本的な統計量を自動集計し、一覧表で表示する機能を持っている。
基本統計量ツールのダイアログボックスで以下のように指定する。
- 入力範囲は、$C$4:$D$29
- チェック:先頭行をラベルとして使用(L)
- チェック:平均の信頼区間の出力(N) [95% ]
- チェック:K 番目に大きな値(A) [1 ]
- チェック:K 番目に小きな値(M) [1 ]
- 出力先: [Sheet2!$A1$1 ]
- 元のデータをこの出力で上書きしてしまわないように注意する。別のワークシートを指定するのが安全である。($Sheet1はもとのデータのあるworksheetとする)
- チェック:統計情報(S)
- 統計情報を指定すると、平均値、標準誤差(=不偏分散/データ数の平方根)、中央値、最頻値、標準偏差、分散、尖度、歪度、範囲、最小、最大、合計、標本数、信頼区間などを一覧表にして出力する。
例題2のデータを、母集団から抽出された1つの標本と見ると、基本統計量ツールの出力項目は推定統計の立場から次のような意味を持ってくる。
- 平均:→ 標本平均。母集団の平均を点推定するときの推定値
- 標準偏差:→ 母集団の標準偏差の推定値
- 分散:→ 不偏分散。 不偏分散は母集団の推定値として、偏りのない推定値であることが知られている。
- 信頼区間:→ 信頼度95%で、母集団の平均値は「区間170.56+-2.190975に存在する」と区間推定される。
| lec.31) Go to TOP |
----- (c) T.K Last updated:
|