レーヴン漸進的マトリックス:言語を使わない非言語式IQテスト
レーヴン漸進的マトリックス(Raven's Progressive Matrices)は、心理学でもっとも知られた非言語推理テストです。抽象的な図形が並んだ格子の一部が空白になっており、そこに入るピースを選ぶ——言葉も計算も一般知識も使いません。1938年の初版から現在まで、研究・採用スクリーニング・言語の異なる集団の評価に使われ続けており、現代の主要なIQバッテリーに含まれる「行列推理」課題の直接の祖先でもあります。この記事では、その成り立ち、問題の作りかた、測れるもの・測れないもの、そしてスコアの読み方を整理します。
1. レーヴン漸進的マトリックスの成り立ち
このテストを作ったのは、イギリスの心理学者ジョン・C・レーヴンです。初版の刊行は1938年。レーヴンは知的障害の成因を研究していたライオネル・ペンローズの研究助手を務めており、識字力や就学年数が大きく異なる人々に対して、現場で短時間に実施できる道具を必要としていました。当時の既存のテストは語彙・一般知識・言語による教示に強く依存しており、集団や地域を越えるとまるで機能しなかったのです。
理論的な出発点はチャールズ・スピアマンにありました。スピアマンの二因子説は、あらゆる認知課題を貫く一般因子(g)の存在を主張し、「関係と相関項の抽出(eduction of relations and correlates)」——物事の関係を見抜き、その関係を新しい事例へ延長する心的操作——を知能の中核に置きました。レーヴンのマトリックスは、まさにこの操作だけを純粋に取り出すよう設計されています。
彼はこのテストを語彙検査(ミル・ヒル語彙尺度)と対にして用いました。語彙検査が測るのは再生的能力(reproductive ability)、つまり学習して蓄えた情報を引き出す力です。対してマトリックスが測るのは抽出的能力(eductive ability)、すなわち既成の意味がついていない材料から自力で秩序を見つける力。この二本立ての発想は、今日の流動性知能と結晶性知能の区別として生き残っています。
このテストの寿命は異例です。1930年代の心理検査で、90年近く経った現在も商業出版され、標準化データが更新され続けているものはほとんどありません。
2. マトリックス問題はどんな形をしているか
レーヴンの問題は著作権で保護されているため、ここで実物を再現することはしません。ただし、その一般的な構造は公知の事実であり、説明することは可能です。
典型的な問題は、抽象図形が並んだ行列を示します。多くは3×3の格子ですが、易しいセットでは2×2や横一列の単純な配置も使われます。右下のセルだけが空白で、その下に6〜8個の候補ピースが並びます。空白に入るピースを選ぶ、それだけです。
設計上、重要な特徴がいくつかあります。
- 言語を必要としない。 教示は身振りでも伝えられます。問題そのものに文字は一切含まれません。
- 予備知識が役に立たない。 使われる図形——矢印、点、斜線、幾何学的な輪郭——は恣意的で、文化的・教育的な内容を含みません。
- 難易度が「漸進的」である。 きわめて易しい問題から始まり、徐々に難しくなります。前半の問題が後半で必要になる論理を実質的に教える構造で、名称の「Progressive(漸進的)」はここに由来します。
- 誤答選択肢が体系的である。 不正解の候補はランダムではありません。多くは「ルールの部分的な適用」を表しています。形は正しいが濃淡が違う、進行のルールを別の次元に適用してしまっている、といった具合です。だから難しい問題ではあてずっぽうがほとんど通用しません。
私たち自身が作った説明用の例を挙げます。ある行で、セル内の点の数が左から右へ1つずつ増えていき、同時にその点を囲む図形が1ステップごとに90度回転する。2つの独立したルールが同時に動いており、空白のセルは両方を満たさなければなりません。難問はこうしたルールをさらに重ねます。
3. テストの主なバージョン
レーヴンは単一のテストを出したわけではありません。マトリックスは能力帯の異なる複数の検査からなる「ファミリー」であり、どれを使うかは対象者の能力帯で決まります。
| バージョン | 略称 | 問題数 | 構成 | 対象 |
|---|---|---|---|---|
| カラー漸進的マトリックス | CPM | 36 | 12問×3セット(A, Ab, B) | 幼い子ども、高齢者、認知機能の低下がある人 |
| 標準漸進的マトリックス | SPM | 60 | 12問×5セット(A〜E) | 一般集団、おおむね6歳から成人まで |
| 標準漸進的マトリックス・プラス | SPM+ | 60 | 12問×5セット | SPMと同じ範囲。天井効果を抑えるため難問を追加 |
| 上級漸進的マトリックス | APM | 12+36 | セットI(練習)、セットII(採点対象) | 能力帯が高い成人・青年 |
| レーヴン漸進的マトリックス第3版 | Raven's 2 | 可変 | デジタル、適応型の出題 | 現代の臨床・職業場面 |
CPMは背景に色を使っており、幼児の注意を保ちやすく、視覚的な負荷も軽くなっています。SPMは、一般に「レーヴン」と言われたときに想定される古典的な形式です。APMが作られたのは、SPMでは分布の上位が圧縮されてしまう——能力の高い成人が天井に張りついてしまう——ためで、その問題はSPMの最難問が終わるあたりから始まります。
2018年にPearsonから刊行された改訂版、通称Raven's 2は、デジタルのコンピュータ適応型形式に移行しました。それまでの解答成績に応じて次の問題の難易度が変わる方式です。適応型の出題は、少ない問題数で同等の精度に達し、固定形式が抱えていた天井・床の問題も緩和します。
実施時間はおおむね20〜45分。レーヴン自身はSPMを時間無制限で行うことを想定していました。速さではなく推理の力を測る道具と考えていたためです。時間制限をつける実施法は後から一般化したもので、これはスコアの意味そのものを変えます。
4. このテストが実際に測っているもの
因子分析研究において、レーヴンのマトリックスは**流動性知能(Gf)**に非常に高く負荷し、それを通じてgにも強く関連します。心理測定の文献では、単独のテストとして一般知能をもっとも強く反映するものの一つと繰り返し評されており、gの簡便な代理指標を必要とする研究者がこのテストに手を伸ばす理由もそこにあります。
認知的に要求されるのは次の3つです。
- ルールの帰納 — わずかな例から抽象的な規則性を推論すること。
- ワーキングメモリと目標管理 — 候補となるルールを検証しながら、部分的に解けたサブゴールを同時に保持すること。
- 関連する次元への注意 — 形・数・濃淡・向き・大きさ・位置といった多数の視覚的属性のうち、どれがパターンを担っているかを見極めること。
認知過程の古典的な分析が**カーペンター、ジャスト、シェル(1990)**の研究です。彼らはAPMの解答過程を詳細にモデル化し、難問を難問たらしめているのは主として「同時に管理すべきルールの数」と「ワーキングメモリにおける目標管理の負荷」であると結論づけました。そこで整理されたルールの型は、次のように少数にまとまります。
| ルールの型 | 内容 |
|---|---|
| 行内での一定 | ある属性が行内では変わらず、行が変わると変化する |
| 量的な段階的進行 | ある属性が行に沿って一定の幅で増減する |
| 図形の加算・減算 | 2つのセルが合成される、または一方から他方が取り除かれて3つ目になる |
| 3値の分配 | ある属性の3つの値が、各行・各列に1回ずつ現れる |
| 2値の分配 | 2つの値が現れ、各行に1つ空値が入る |
この一覧が示唆することに注目してください。このテストは狭い意味での「視覚能力」を測っているのではありません。抽象的な仮説を負荷のかかった状態でどれだけ効率よく生成し、検証し、保持できるか——測っているのはそちらです。
脳画像研究は、行列推理の成績を前頭-頭頂の分散したネットワークと関連づけてきました。ユングとハイアーの頭頂前頭統合理論(2007)がその知見をまとめたものです。ただしこれらは成績の相関物を記述するものであり、「知能」を脳の一点に局在させるものではありません。
5. 「文化公平」をめぐる問い
レーヴンのマトリックスは、しばしば「文化フリー」あるいは「文化公平」と呼ばれます。前者は端的に誤りで、後者もよくて近似にすぎません。
たしかにこのテストは、目に見えやすい文化的障壁を取り除いています。言語がなく、語彙もなく、教育課程の内容もなく、特定文化に固有の事物も登場しません。これは本物の利点であり、言語をまたぐ研究や、検査者と受検者が共通の言語を持たない場面へこのテストが広まった理由でもあります。
しかし文化の影響を減らしたことと文化と無縁であることは同じではありません。成績は、依然として不均等に分布する要因に左右されます。
- 二次元の抽象図形への慣れ。 これは主として学校教育と、印刷物や画面上の図表に触れてきた経験の産物です。
- 受検作法。 多肢選択形式、答えが1つ「正解」だという前提、制限時間の中で黙って一人で取り組むこと。日本の学校で長く紙の試験を受けてきた人にとって自明な作法も、普遍的なものではありません。
- 就学年数。 教育の内容とは独立に、就学年数そのものが行列課題の成績と相関します。
現代の心理測定学における合意はこうです。文化フリーなテストは存在しない。レーヴンは特定のバイアス源をかなりの程度減らしている。ただしその低減を、集団を越えた普遍的な比較可能性の主張にまで拡大してはならない。
6. レーヴンとフリン効果
フリン効果——20世紀を通じて認知テストの平均粗点が長期的に上昇し続けた現象——が最も劇的に観察されたのは、まさにレーヴン型のテストでした。ジェームズ・フリンらは、抽象的な行列推理での上昇幅が語彙や一般知識のテストでの上昇幅を大きく上回ることを見出しており、一部の国のデータでは一世代あたり標準偏差1つ分に達する規模でした。
これは「文化公平なテスト」という読みにとって、かなり厄介な結果です。もしマトリックスが環境に左右されない固定的な生物学的能力を測っているのなら、世代を追うごとにスコアがこれほど急に押し上げられるはずがありません。有力な説明はむしろ環境の変化を指しています。就学年数の伸び、図やシンボルで飽和した視覚環境、そしてフリン自身が好んだ説明——具体的なカテゴリーより抽象的・仮説的・分類的なカテゴリーを日常的に使う文化的シフト、です。
実務上の帰結が2つあります。第一に、基準(ノルム)には賞味期限がある。 同じ粗点でも1979年の基準表と2018年の基準表では結果が異なり、古い基準のほうが受検者に甘く出ます。第二に、テストの平均成績が上がったことは、集団があらゆる面で賢くなったことと同義ではありません。上昇の幅は認知領域によってきわめて不均等で、実はその不均等さこそがこの発見のもっとも情報量の多い部分なのです。
7. レーヴンのスコアはどう報告されるか
粗点は単純に正答数です。SPMなら60点満点、APMのセットIIなら36点満点。この数字は、それだけでは何の意味も持ちません。該当する年齢層・母集団の**基準表(ノルム表)**と照合され、パーセンタイルに変換されて初めて解釈可能になります。
出版社によっては、さらにパーセンタイルを平均100・標準偏差15の標準得点尺度に変換します。ウェクスラー型のIQスコアと並べて議論できるようにするためです。ただしこの変換は便宜であって等価ではありません。レーヴンから導かれた標準得点と、WAISの全検査IQは、異なる内容から構成されており、互換ではないのです。
レーヴンに由来するどの数値にも、次の3つの注意が当てはまります。
- 単一領域の測度である。 マトリックスが評価するのは流動的・非言語的な推理です。言語理解、獲得された知識、処理速度については何も語りません。完全なバッテリーが複数の領域を測るのは、まさにこのためです。
- 測定誤差を伴う。 どのテストでも観測されたスコアは推定値です。よく標準化されたスコアの95%信頼区間は、通常、観測値の上下に数点ずつの幅を持ちます。
- 練習が変えるのはスコアであって人ではない。 行列パズルをたくさん解いた人は、行列パズルが上手くなります。それは問題形式と頻出ルール型への慣れ、つまり課題特異的な学習を反映したものであり、基礎にある一般的な能力の変化と読むべきものではありません。
8. 現代のどこでマトリックスに出会うか
レーヴンのテスト自体を受けたことがなくても、その設計にはほぼ確実に出会っています。**行列推理(Matrix Reasoning)**はWAIS-IVとWISC-Vの中核下位検査です。同種の図形行列課題は、スタンフォード・ビネー、キャッテル文化公平テスト、ナグリエリ非言語能力テスト、職業適性検査バッテリー、そしてネット上に流通する無料テストの相当部分に登場します。
高IQ団体の一部の国内支部は、監督下で実施された上級漸進的マトリックスのスコアを入会審査の資料として受け入れてきましたが、基準は国によって異なり、時期によっても変わります。この経路を考えている人は、又聞きのリストではなく、団体に直接、現行の要件を確認してください。
Brambinのプロファイルに含まれるパターン推理課題を含め、オンラインの行列テストは同じ論理を用いていますが、商標であるレーヴンの検査そのものではなく、標準化された条件下で実施されるものでもありません。好奇心と自己理解のためには有用です。臨床的評価ではなく、その代わりにもなりません。
よくある質問(FAQ)
レーヴン漸進的マトリックスはIQテストですか?
一般知能ときわめて強く相関する非言語的な流動性推理のテストであり、結果は平均100・標準偏差15というIQ的な尺度に変換されることも多くあります。ただし測っているのは1つの領域であり、WAISのような完全なバッテリーが扱う複数の領域とは違います。同じ尺度に印字されていても、レーヴンの結果と全検査IQは同じ量ではありません。
所要時間はどのくらいですか?
バージョンと実施法によります。標準漸進的マトリックス(SPM)は通常20〜45分で、集団実施の場面では45分の制限時間がよく使われます。レーヴン自身は速さではなく推理の力を対象とする立場から時間無制限を想定しており、一部の研究では現在も無制限で実施されています。
レーヴンは本当に「文化フリー」ですか?
いいえ。「文化の影響を減らした(culture-reduced)」と表現するほうが正確です。言語と教育課程の内容を取り除くことで大きなバイアス源はいくつか消えますが、成績は依然として抽象的な二次元図形への慣れ、学校教育、受検作法に左右され、これらは環境によって差があります。現在では、文化フリーという語は言い過ぎだと多くの心理測定学者が考えています。
練習すればレーヴン型のパズルは上達しますか?
行列パズルの成績は練習で向上します。頻出のルール型に慣れ、形式に驚かなくなるからです。研究が支持しているのは、これが課題特異的な学習だという点です。伸びは練習した課題に現れ、無関係な認知課題へはほとんど転移しません。一般的な推理能力が変化したと解釈すべきものではなく、臨床家が直近に再受検されたスコアを割り引いて扱う理由でもあります。
なぜバージョンがこんなに多いのですか?
60問の単一形式では、能力帯の全域を正確に測ることができないからです。カラー版があるのは、幼い子どもや認知機能の低下がある成人が、難しすぎるテストの床に張りついてしまわないため。上級版があるのは、能力の高い成人が易しすぎるテストの天井に張りついてしまわないため。現代の適応型版は、出題を成績に応じて選ぶことで、この2つの問題に同時に対処しています。
本物のレーヴンの問題はどこで見られますか?
正規のかたちで公開されている場所はありません。問題はライセンスのもとで出版される著作物であり、その機密性には意味があります。広く出回った問題は、標準化されたときに測っていたものをもう測れないからです。形式を模した練習教材は存在しますが、それはテストそのものではなく、そのスコアを標準化されたレーヴンの結果と比べることはできません。
まとめ
レーヴン漸進的マトリックスが1938年から生き延びてきたのは、ひとつのことを飛び抜けてうまくやるからです。抽象的なルールの帰納を、言語・知識・教育課程から切り離して取り出すこと。だからこそ、これは流動性推理のもっとも純粋な指標のひとつであり、この分野でもっとも広く使われる研究道具のひとつでもあります。
限界も同じくらい明確です。測るのは単一の認知領域です。文化フリーではなく、文化の影響を減らしたテストです。基準は時代とともにずれていき、そのことをフリン効果はどのテストよりも鮮やかにこのテストの上で示しました。そして、そこから出るスコアは信頼区間を伴う推定値であって、その人に固定的に備わった性質ではありません。
他の情報と並べて読めば、行列推理の結果は確かに有益です。単独で、判決として読むなら、それは本来担うよう作られたものをはるかに超えた重さを負わされていることになります。
Brambinは、パターン推理課題を含む8領域の認知プロファイルを、自己理解のためのツールとして提供しています。レーヴン漸進的マトリックスそのものではなく、その出版社と提携関係もなく、臨床的評価でもありません。当社のものを含めて、どのようなオンラインスコアも、好奇心の出発点として扱ってください。判決ではありません。