知识

瑞文推理测验:最著名的非语言智力测验

瑞文推理测验(Raven's Progressive Matrices)是心理学中知名度最高的非语言推理测验。它给出一组由抽象图形组成、缺了一格的矩阵,要求受测者判断哪一个选项能补全整体规律——不涉及文字、不涉及计算、也不依赖常识储备。这项测验 1938 年首次出版,至今仍用于研究、职业筛选和跨语言评估,现代主流智力量表中的「矩阵推理」分测验也直接源自它。本文说明它的来历、题目如何构成、它测到与测不到什么,以及分数应该怎么读。

1. 瑞文推理测验的由来

这项测验由英国心理学家**约翰·瑞文(John C. Raven)编制,第一版发表于 1938 年。瑞文早年曾担任莱昂内尔·彭罗斯(Lionel Penrose)**的研究助理,参与一项关于智力障碍成因的研究。他需要一件能在实地快速施测的工具,而受测对象的识字程度和受教育年限差异极大。当时通行的测验大量依赖词汇、常识和口头指导语——这些东西一旦跨越语言和地区就失效了。

瑞文的理论出发点来自查尔斯·斯皮尔曼(Charles Spearman)。斯皮尔曼的二因素理论提出,所有认知任务背后都贯穿着一个一般因素(g)。他描述过一种心理操作,称为「关系的推演与相关项的推演」——察觉事物之间如何关联,并把这种关联延伸到新的情境中。瑞文设计矩阵题,就是要把这一操作尽可能纯粹地单独提取出来。

他同时把矩阵测验与一套词汇测验(米尔希尔词汇量表)配对使用,后者测量他所说的再现能力:一个人能够调取的既有知识储备。而矩阵测验测的是推演能力:面对本身不带现成意义的材料,如何从中理出条理。这一对工具的本意是给出双面的图景,而不是一个单一数字——这个设计思路今天仍存活在流体智力与晶体智力的区分之中。

这项测验的寿命相当罕见。1930 年代的心理测量工具中,能在近九十年后仍在正式出版、并持续更新常模的,屈指可数。

2. 一道矩阵题长什么样

瑞文测验的题目受版权保护,因此本文不会复制任何真题。但它的一般结构属于公开知识,可以描述。

典型题目呈现一个抽象图形矩阵——常见为 3 × 3 的九宫格,最简单的几组则使用 2 × 2 或单行排列。右下角一格空白。矩阵下方列出若干候选图形,通常六个或八个。任务是判断哪个候选项属于那个空格。

这一设计有几点值得留意:

  • 不需要语言。 必要时指导语可以用手势示意,题目本身不含任何文字。
  • 先备知识帮不上忙。 图形是任意的——箭头、圆点、网格底纹、几何轮廓——不承载任何文化或学科内容。
  • 难度是「渐进」的。 题目按由易到难排列,前面的题目实际上在教会你后面题目所依赖的逻辑。测验名称中的「渐进」即由此而来。
  • 干扰项经过系统设计。 错误选项不是随机的,它们通常代表「规则只用对了一半」:形状对了但底纹错、递进关系用在了错误的维度上,诸如此类。这就是为什么在难题上靠猜很难奏效。

举一个我们自己编的例子:设想一行中每格的圆点数量从左到右依次加一,同时包住圆点的外框每一步旋转九十度。两条独立规则同时运作,缺失的那一格必须同时满足两者。更难的题目会把好几条这样的规则叠加起来。

3. 测验的主要版本

瑞文从未推出过唯一的一份测验。这套矩阵是一个针对不同能力区间的工具家族,而能力区间正是决定该用哪一版的依据。

版本 简称 题数 结构 适用对象
彩色推理测验 CPM 36 3 组各 12 题(A、Ab、B) 幼儿、高龄者、认知功能受损者
标准推理测验 SPM 60 5 组各 12 题(A–E) 一般人群,大致 6 岁至成人
标准推理测验加强版 SPM+ 60 5 组各 12 题 同 SPM,加入更难题目以减少天花板效应
高级推理测验 APM 12 + 36 第 I 组(练习)、第 II 组(计分) 能力区间偏上的成人与青少年
瑞文推理测验第三版 Raven's 2 不固定 数字化、自适应选题 现代临床与职业情境

CPM 使用彩色背景,更能维持幼儿的注意力,也降低视觉负荷。SPM 是经典形式,多数人说「瑞文测验」时指的就是它。APM 之所以问世,是因为 SPM 会把分布顶端压扁——太多能力较强的成人撞到天花板——所以 APM 的题目从 SPM 最难的题目结束之处开始。

2018 年由培生出版的修订版,通称 Raven's 2,将测验转为数字化的计算机自适应形式:下一题的难度取决于此前的作答表现。自适应施测能以更少的题目达到相当的测量精度,也缓解了固定题本版本的天花板与地板问题。

施测时间通常为 20 至 45 分钟。瑞文最初主张 SPM 不限时,认为它测的是推理能力而非速度;限时施测是后来才普及的做法,而这会改变分数所反映的内容。

4. 这项测验究竟测什么

在因素分析研究中,瑞文矩阵在**流体智力(Gf)**上有很高的负荷,并经由流体智力反映 g。心理测量学文献中普遍将它描述为现有单一测验中最强的一般智力标记之一——这也是研究者需要一个简短的 g 代理指标时如此频繁地选用它的原因。

从认知角度看,它要求的是:

  • 规则归纳——从少量例子中推断出抽象的规律性。
  • 工作记忆与目标管理——在检验候选规则的同时,把几个部分完成的子目标同时保持在脑中。
  • 对相关维度的注意分配——判断众多视觉属性(形状、数量、底纹、朝向、大小、位置)中,究竟哪一个才承载着规律。

经典的认知分析来自 Carpenter、Just 与 Shell(1990)。他们详细建模了 APM 上的作答表现,结论是较难题目的区分点主要在于需要同时管理的规则数量,以及工作记忆中目标管理的负担。他们归纳出为数不多的几类反复出现的规则:

规则类型 作用方式
行内恒定 某属性在一行内保持不变,在行与行之间变化
数量上的成对递进 某属性沿一行以固定步长递增或递减
图形相加或相减 两格合并,或从其中一格中减去另一格,得到第三格
三值分布 某属性的三个取值在每行每列各出现一次
二值分布 每行出现两个取值,另一格为空

值得注意的是这份清单的言外之意:这项测验并非在狭义上测量「视觉能力」。它测的是一个人在负荷之下生成、检验并保持抽象假设的效率。

脑影像研究把矩阵推理表现与一个分布式的额顶网络联系起来——即 Jung 与 Haier 的顶额整合理论(2007)所概括的模式。这些发现描述的是表现的神经相关物,并不意味着把「智力」定位在大脑的某一个点上。

5. 关于「文化公平」的争议

瑞文矩阵常被称作「无文化偏差」或「文化公平」。前一个说法是错的,后一个充其量是个近似。

它确实移除了最明显的文化障碍:没有语言、没有词汇、没有课程内容、没有特定文化才有的物件。这是实打实的优势,也是它得以广泛进入跨语言研究、以及主试与受测者语言不通的场合的原因。

但降低文化依赖不等于没有文化依赖。表现仍然取决于一些在人群中分布并不均匀的东西:

  • 对二维抽象图形的熟悉度,这在很大程度上是正规学校教育以及接触印刷品与屏幕材料的产物。
  • 应试惯例——选择题形式、「有且只有一个正确答案」的假设、独自安静作答并受时间约束。
  • 受教育年限,它与矩阵测验表现的相关独立于所受教育的具体内容。

当代心理测量学的共识立场是:没有任何测验是无文化偏差的;瑞文测验确实大幅降低了某些偏差来源;但这种降低不应被夸大成「可以跨人群普遍比较」的主张。

6. 瑞文测验与弗林效应

弗林效应——二十世纪认知测验平均原始分数的长期上升——最戏剧性的证据正来自瑞文这一类测验。詹姆斯·弗林等人发现,抽象矩阵推理上的增长幅度显著大于词汇或常识测验上的增长,在部分国家的数据中,一代人之间的涨幅达到约一个标准差的量级。

对于「文化公平」的解读而言,这是个相当尴尬的结果。如果矩阵测量的是一种不受环境触动的固定生物能力,代际分数就不该如此陡峭地漂移。主流解释转向了环境变迁:受教育年限增加、视觉环境被图表与符号充满,以及弗林本人偏好的说法——文化上出现了一种转向,人们越来越习惯使用抽象的、假设性的、分类式的范畴,而非具体范畴。

由此有两个实务上的推论。第一,常模会过期。同一个原始分数对照 1979 年常模与对照 2018 年常模,结果并不相同,而旧常模会让受测者显得更好看。第二,一项测验上平均表现的上升,并不等于一个人群在所有认知方面都变强了;增长在各认知领域之间高度不均,而这种不均本身才是这一发现中信息量最大的部分。

7. 瑞文测验的分数如何呈报

原始分数就是答对的题目数——SPM 满分 60,APM 第 II 组满分 36。这个数字本身没有意义。只有对照适用年龄组与人群的常模表、转换为百分位之后,它才可解释。

一些出版方还会把百分位进一步换算成均值 100、标准差 15 的标准分量表,以便与韦氏类的智商分数放在一起讨论。这种换算是为了方便,不代表等价:由瑞文测验导出的标准分与全量表韦氏智商建立在不同的内容之上,两者不可互换。

任何由瑞文测验得出的数字,都要注意三点:

  1. 它是单一领域的测量。 矩阵测的是流体的非语言推理,对言语理解、习得知识或加工速度不置一词。综合量表之所以要抽样多个领域,正是为此。
  2. 它带有测量误差。 与任何测验一样,观测分数只是一个估计值。常模良好的分数,其 95 % 置信区间通常在观测值两侧各延伸若干分。
  3. 练习改变的是分数,不是人。 做过大量矩阵题的人,会更擅长做矩阵题。这种进步反映的是对题型格式与常见规则类型的熟悉——属于任务特定的学习——不应被读成底层一般能力发生了变化。

8. 今天你会在哪里遇到矩阵题

即便你从未做过瑞文测验本身,也几乎肯定见过它的设计。矩阵推理是 WAIS-IV 与 WISC-V 的核心分测验之一。类似的图形矩阵任务出现在斯坦福-比奈量表、卡特尔文化公平测验、纳格利里非语言能力测验、各类职业性向组合测验中,也出现在网上流传的大量免费测验里。

一些高智商团体的国家分会曾接受在监督条件下取得的高级推理测验成绩,作为入会证据的一部分,但各国标准不同且会随时间调整——有意走这条路的人,应直接向该组织确认当前要求,而不要依赖二手整理的清单。

包括 Brambin 认知剖面中的图形推理题在内,网络上的矩阵测验使用的是同一套底层逻辑,但它们不是注册商标的瑞文测验,也不在标准化条件下施测。它们适合满足好奇心与自我了解,不是临床评估,也无法替代临床评估。

常见问题

瑞文推理测验算是智力测验吗?

它是一项非语言流体推理测验,与一般智力的相关非常高,其结果也常被换算到均值 100、标准差 15 的类智商量表上。但它测的是单一领域,而像 WAIS 这样的综合量表覆盖多个领域,因此即便印在同一个量表上,瑞文测验的结果与全量表智商也不是同一个量。

这项测验要做多久?

取决于版本与施测方式。标准推理测验通常需要 20 至 45 分钟;团体限时施测中常见 45 分钟上限。瑞文最初的设计是不限时的,理由是关注对象应为推理能力而非速度,某些研究情境至今仍采用不限时施测。

瑞文测验真的没有文化偏差吗?

不是。更准确的说法是它降低了文化依赖。移除语言与课程内容确实消除了几个很大的偏差来源,但表现仍取决于对抽象二维图形的熟悉度、正规教育年限以及应试惯例,而这些在不同环境中差异很大。多数心理测量学者如今认为「无文化偏差」是一种夸大。

多做练习能在瑞文式题目上表现更好吗?

矩阵题的表现确实会随练习而进步,因为常见的规则类型变得熟悉,题型也不再令人意外。研究支持的结论是:这属于任务特定的学习,进步出现在被练习的任务上,向无关认知任务的迁移很差。它不应被解读为一般推理能力发生了变化,这也是临床工作者对短期内重复施测所得分数持保留态度的原因之一。

为什么会有这么多不同版本?

因为一份 60 题的固定题本无法在整个能力区间上都测得准确。彩色版的存在,是为了让幼儿和认知功能受损的成人不至于卡在一份过难测验的地板上;高级版的存在,是为了让能力较强的成人不至于卡在一份过易测验的天花板上。现代自适应版本则通过依据作答表现选题,一次性缓解了这两个问题。

哪里能看到真正的瑞文测验题目?

正当途径上看不到。这些题目是按授权出版的版权材料,其保密性很重要:一道广泛流传的题目,就不再测量它当初建立常模时所测量的东西。模仿这一格式的练习材料确实存在,但那不是这项测验,其分数也无法与有常模的瑞文测验结果相比较。

小结

瑞文推理测验自 1938 年沿用至今,是因为它把一件事做得格外好:把抽象规则归纳从语言、知识和课程内容中剥离出来。这使它成为流体推理最纯粹的可用标记之一,也成为该领域使用最广的研究工具之一。

它的局限同样清楚。它测量的是单一认知领域。它是文化依赖被降低,而非被消除。它的常模会漂移——弗林效应在这项测验上体现得比在任何其他测验上都更为鲜明。而它给出的分数是一个带置信区间的估计值,不是一个人的固定属性。

与其他证据合起来读,矩阵推理的结果确实富有信息量。孤立地读、当作定论来读,就是要求它承担远超其设计初衷的分量。


Brambin 提供一个面向自我了解的八维认知剖面,其中包含图形推理题目。它不是瑞文推理测验,与该测验的出版方没有任何关联,也不是临床评估。请将任何在线分数——包括我们的分数——视为好奇心的起点,而不是判决。

用完整测试查看完整分数

免费下载 · 完整测试为一次性应用内购买,无订阅

下载Brambin
下载应用