本文へ
StatPlayコラム多変量解析でできること
// MULTIVARIATE ANALYSIS

多変量解析で
できること

多変量解析。名前は難しそうですが、実際には何をしているんでしょうか。図を動かしながら、少し眺めてみたいと思います。

カフェのアンケートから

まずは、カフェのアンケートを並べてみます。

架空のカフェアンケート90人分から、6人を表示

このデータを見る ↓

同じアンケートを使った、別々の分析の例です。

図を動かしてみる

1. カフェのアンケートから

カフェの味はよかったけれど、席は落ち着かなかった。そんな感想を、六つの点数にしてみます。

FIG. 01

まずは、六つの評価を並べてみる。

味・接客・静かさ・席・内装・価格への納得感 / 各0〜100点

1行が、ひとり分の回答です。
低い高い

90人分の架空データから6人を抜粋。各マスの数値で、色を使わずにも比較できます。

図1:90人分の架空データの一部。各項目は0〜100点。総合満足度は別に尋ねています。

味の点数が同じでも、接客や席の点数まで同じとは限りません。そんな違いを、いくつかの項目を一緒に扱うことで見てみます。ここでは重回帰も含め、複数の変数を扱う手法を広く取り上げます。

2. 重回帰分析:満足度を予測してみる

味や接客、席の評価から、総合満足度を予測してみます。まずは味の点数だけを動かして、予測がどのくらい変わるか見てみましょう。

FIG. 02

味や席の点数を変えてみる。

6項目 → 総合満足度の予測 / 架空データに当てはめたモデル

総合満足度の予測
図の状態は下の文章で確認できます。
右の棒:予測値にプラス左の棒:予測値にマイナス

棒と予測式の関係

各棒は bⱼ ×(評価 xⱼ − その項目の平均)。予測値は、平均的な回答の予測値に六項目の寄与を足した値です。固定した四項目の寄与は0なので、図では味と席の二本を表示しています。通常の式 ŷ = b₀ + b₁x₁ + … + b₆x₆ と同じ計算です。

図2:六項目の重回帰モデル。動かす二項目だけを表示し、残り四項目は平均値に固定。棒は平均的な回答からの予測の増減です。

味の点数を動かすと、予測の数字も動きます。次は味をそのままにして、席の点数を変えてみます。どちらを動かすかで、変わり方も少し違いますね。

ほかの条件を固定したとき、一項目が1点違うと予測が何点変わるか。その大きさが、偏回帰係数に当たります。

予測と、実際に変えたときの効果

この図はモデル上の予測です。料理を改善すれば同じ分だけ満足度が上がると、アンケートだけで確かめたわけではありません。

3. 主成分分析:二つの点数を、一本の軸へ

次は、味と接客の二つの点数を、一本の数直線にまとめてみます。項目を減らしたときに、元の違いがどのくらい残るのか。図のAとBを追ってみます。

FIG. 03

向きを変えて、AとBを見比べてみる。

同じ90人・同じ2項目。変えるのは、見る向きだけ。

図の状態は下の文章で確認できます。

● A ◆ B
残るばらつき

味と接客を標準化。A・Bの色と形は、写す前後で同じです。

この動きが「主成分」になる理由

一本に写した値は、元の二項目を重みつきで足したもの。重みの長さを一定にして、その値の分散が最大になる向きが第1主成分です。「残るばらつき」は投影後の分散を元の二項目の分散の和で割った割合。A・Bは対応を追うための例で、向きは90人全体のばらつきで決まります。

図3:味・接客を標準化した例。元の点と写した点は、同じ色・同じ形。数直線の尺度は、向きを変えても固定です。

「つぶれる向き」では、離れていたAとBがほぼ同じ位置に来ます。「広がる向き」に変えると、今度は別々の位置に写ります。

同じ点でも、まとめる向きでこんなに変わるんですね。

この図では、一本に写したときに90人全体のばらつきが最も大きくなる向きを探しています。それが第1主成分の向きです。

項目が六つになると絵にはしづらいですが、少ない軸にまとめる、という考え方は同じです。元の数値を組み合わせて、新しい座標を作ります。

一本にすると、何が失われる?

その軸と垂直な方向の違いです。表示された「残るばらつき」は、元の二項目の分散のうち、一本に残せた割合。ばらつきを多く残すことと、総合満足度をよく予測することは別の目的です。

4. 因子分析:共通するものがあるとしたら

静かさ、席、内装への評価が、一緒に高くなったり低くなったりするとしたら。何か共通するものがあるのかもしれません。ここでは、ひとまず「居心地への評価」という共通因子を置いて、動きを見てみます。

FIG. 04

「居心地」を仮に置いてみる。

共通因子を仮定した模式図 / 固有部分は固定

共通因子の値
動かすと、三項目がそれぞれの重みで変わる
図の状態は下の文章で確認できます。

この図で置いたモデル

各評価 = 60 + 15 × 重み × 共通因子 + 固有部分。重みは静かさ0.85、席0.75、内装0.65。固有部分は順に−3点、+4点、−1点で固定しています。矢印は仮定したモデルの関係で、因果関係を実証したものではありません。実際の因子分析では、観測項目の相関からモデルを推定します。

図4:共通因子を仮定した模式図。実際の回答から因子を推定した結果ではありません。

「共通の動きを見る」を押すと、三本の棒が一緒に伸び縮みします。動く幅は少しずつ違います。因子との結びつきに、それぞれ違う重みを置いているためです。

実際の因子分析では、回答の相関をもとに、このような共通因子を使ったモデルを当てはめます。項目ごとの変動や測定誤差も含めて考えます。

主成分分析と似て見えるところもありますが、こちらは共通因子を仮定して項目どうしの関係を考えます。元の数字を組み合わせて座標を作る主成分分析とは、出発点が違います。

「居心地」は、計算で見つかる?

名前は項目の内容を見てつける解釈です。計算だけで「居心地」という心理的な実体や、因果関係が確かめられるわけではありません。

5. クラスター分析:回答が似た人を同じ組に

最後は、味と席への評価が似た人をグループに分けてみます。「分かれる過程を見る」を押すと、点の位置はそのままで、所属するグループや中心が変わっていきます。

FIG. 05

点はそのまま。まとまり方が変わる。

味・席の2項目で分類 / 同じ0〜100点の尺度

グループ数を変える

図の状態は下の文章で確認できます。

この図の「似ている」の決め方

味と席の点数から、通常のユークリッド距離を使います。k-means法でグループ内の中心からの距離の二乗和を小さくします。初期値や使う変数を変えると、結果も変わることがあります。この図の分類には残り四項目を使っていません。

図5:味・席の二項目を使ったk-means法。色と形はグループ、十字は中心です。

近い中心の組に入り、その組の平均位置へ中心が動く。この繰り返しで、グループができていきます。

ただ、三組に分かれたからといって、お客さんが本当に三種類いるとまでは言えません。グループ数を変えてみると、同じデータでも別の分かれ方になります。

6. 同じデータで、いくつか試してみると

知りたいこと 手法 計算するもの
一つの結果を予測したい 重回帰分析 係数と、目的変数の予測値
少数の座標で全体を見たい 主成分分析 新しい軸と、各人の座標
共通した動きを表したい 因子分析 因子と各項目の結びつきなど
似た回答の人をまとめたい クラスター分析 グループへの所属など

どれも同じアンケートですが、予測したり、項目をまとめたり、似た回答を探したりと、やっていることは少しずつ違います。

「多変量解析」とひとまとめにすると難しそうですが、まずはこのくらいのイメージからでもよさそうです。気になった手法があれば、図を動かしたり、参考書の説明と見比べたりしてもらえればと思います。