多変量解析で
できること
多変量解析。名前は難しそうですが、実際には何をしているんでしょうか。図を動かしながら、少し眺めてみたいと思います。
1. カフェのアンケートから
カフェの味はよかったけれど、席は落ち着かなかった。そんな感想を、六つの点数にしてみます。
まずは、六つの評価を並べてみる。
味・接客・静かさ・席・内装・価格への納得感 / 各0〜100点
90人分の架空データから6人を抜粋。各マスの数値で、色を使わずにも比較できます。
図1:90人分の架空データの一部。各項目は0〜100点。総合満足度は別に尋ねています。
味の点数が同じでも、接客や席の点数まで同じとは限りません。そんな違いを、いくつかの項目を一緒に扱うことで見てみます。ここでは重回帰も含め、複数の変数を扱う手法を広く取り上げます。
2. 重回帰分析:満足度を予測してみる
味や接客、席の評価から、総合満足度を予測してみます。まずは味の点数だけを動かして、予測がどのくらい変わるか見てみましょう。
味や席の点数を変えてみる。
6項目 → 総合満足度の予測 / 架空データに当てはめたモデル
棒と予測式の関係
各棒は bⱼ ×(評価 xⱼ − その項目の平均)。予測値は、平均的な回答の予測値に六項目の寄与を足した値です。固定した四項目の寄与は0なので、図では味と席の二本を表示しています。通常の式 ŷ = b₀ + b₁x₁ + … + b₆x₆ と同じ計算です。
図2:六項目の重回帰モデル。動かす二項目だけを表示し、残り四項目は平均値に固定。棒は平均的な回答からの予測の増減です。
味の点数を動かすと、予測の数字も動きます。次は味をそのままにして、席の点数を変えてみます。どちらを動かすかで、変わり方も少し違いますね。
ほかの条件を固定したとき、一項目が1点違うと予測が何点変わるか。その大きさが、偏回帰係数に当たります。
予測と、実際に変えたときの効果
この図はモデル上の予測です。料理を改善すれば同じ分だけ満足度が上がると、アンケートだけで確かめたわけではありません。
3. 主成分分析:二つの点数を、一本の軸へ
次は、味と接客の二つの点数を、一本の数直線にまとめてみます。項目を減らしたときに、元の違いがどのくらい残るのか。図のAとBを追ってみます。
向きを変えて、AとBを見比べてみる。
同じ90人・同じ2項目。変えるのは、見る向きだけ。
味と接客を標準化。A・Bの色と形は、写す前後で同じです。
この動きが「主成分」になる理由
一本に写した値は、元の二項目を重みつきで足したもの。重みの長さを一定にして、その値の分散が最大になる向きが第1主成分です。「残るばらつき」は投影後の分散を元の二項目の分散の和で割った割合。A・Bは対応を追うための例で、向きは90人全体のばらつきで決まります。
図3:味・接客を標準化した例。元の点と写した点は、同じ色・同じ形。数直線の尺度は、向きを変えても固定です。
「つぶれる向き」では、離れていたAとBがほぼ同じ位置に来ます。「広がる向き」に変えると、今度は別々の位置に写ります。
同じ点でも、まとめる向きでこんなに変わるんですね。
この図では、一本に写したときに90人全体のばらつきが最も大きくなる向きを探しています。それが第1主成分の向きです。
項目が六つになると絵にはしづらいですが、少ない軸にまとめる、という考え方は同じです。元の数値を組み合わせて、新しい座標を作ります。
一本にすると、何が失われる?
その軸と垂直な方向の違いです。表示された「残るばらつき」は、元の二項目の分散のうち、一本に残せた割合。ばらつきを多く残すことと、総合満足度をよく予測することは別の目的です。
4. 因子分析:共通するものがあるとしたら
静かさ、席、内装への評価が、一緒に高くなったり低くなったりするとしたら。何か共通するものがあるのかもしれません。ここでは、ひとまず「居心地への評価」という共通因子を置いて、動きを見てみます。
「居心地」を仮に置いてみる。
共通因子を仮定した模式図 / 固有部分は固定
動かすと、三項目がそれぞれの重みで変わる
この図で置いたモデル
各評価 = 60 + 15 × 重み × 共通因子 + 固有部分。重みは静かさ0.85、席0.75、内装0.65。固有部分は順に−3点、+4点、−1点で固定しています。矢印は仮定したモデルの関係で、因果関係を実証したものではありません。実際の因子分析では、観測項目の相関からモデルを推定します。
図4:共通因子を仮定した模式図。実際の回答から因子を推定した結果ではありません。
「共通の動きを見る」を押すと、三本の棒が一緒に伸び縮みします。動く幅は少しずつ違います。因子との結びつきに、それぞれ違う重みを置いているためです。
実際の因子分析では、回答の相関をもとに、このような共通因子を使ったモデルを当てはめます。項目ごとの変動や測定誤差も含めて考えます。
主成分分析と似て見えるところもありますが、こちらは共通因子を仮定して項目どうしの関係を考えます。元の数字を組み合わせて座標を作る主成分分析とは、出発点が違います。
「居心地」は、計算で見つかる?
名前は項目の内容を見てつける解釈です。計算だけで「居心地」という心理的な実体や、因果関係が確かめられるわけではありません。
5. クラスター分析:回答が似た人を同じ組に
最後は、味と席への評価が似た人をグループに分けてみます。「分かれる過程を見る」を押すと、点の位置はそのままで、所属するグループや中心が変わっていきます。
点はそのまま。まとまり方が変わる。
味・席の2項目で分類 / 同じ0〜100点の尺度
この図の「似ている」の決め方
味と席の点数から、通常のユークリッド距離を使います。k-means法でグループ内の中心からの距離の二乗和を小さくします。初期値や使う変数を変えると、結果も変わることがあります。この図の分類には残り四項目を使っていません。
図5:味・席の二項目を使ったk-means法。色と形はグループ、十字は中心です。
近い中心の組に入り、その組の平均位置へ中心が動く。この繰り返しで、グループができていきます。
ただ、三組に分かれたからといって、お客さんが本当に三種類いるとまでは言えません。グループ数を変えてみると、同じデータでも別の分かれ方になります。
6. 同じデータで、いくつか試してみると
| 知りたいこと | 手法 | 計算するもの |
|---|---|---|
| 一つの結果を予測したい | 重回帰分析 | 係数と、目的変数の予測値 |
| 少数の座標で全体を見たい | 主成分分析 | 新しい軸と、各人の座標 |
| 共通した動きを表したい | 因子分析 | 因子と各項目の結びつきなど |
| 似た回答の人をまとめたい | クラスター分析 | グループへの所属など |
どれも同じアンケートですが、予測したり、項目をまとめたり、似た回答を探したりと、やっていることは少しずつ違います。
「多変量解析」とひとまとめにすると難しそうですが、まずはこのくらいのイメージからでもよさそうです。気になった手法があれば、図を動かしたり、参考書の説明と見比べたりしてもらえればと思います。