博客知识

WAIS-IV 韦氏成人智力量表:结构、分测验与测量内容

WAIS-IV 韦氏成人智力量表:结构、分测验与测量内容

韦氏成人智力量表第四版(Wechsler Adult Intelligence Scale, Fourth Edition,简称 WAIS-IV)是全世界使用最广泛的成人个别施测智力量表。它于 2008 年出版,由四大指数和十五个分测验构成,最终汇总为一个总智商(FSIQ),每个分测验各自针对认知功能的不同侧面。本文说明这套工具是如何组织的、每个指数与分测验想捕捉什么、分数是怎样换算出来的,以及同样重要的一点——WAIS-IV 的结果不能告诉你什么。

1. WAIS-IV 的来历

大卫·韦克斯勒(David Wechsler)在 1939 年发表了第一版韦氏—贝勒维智力量表,起因正是他对当时可用测验的不满。当时的主流工具斯坦福—比奈量表主要围绕儿童开发,用「心理年龄」与实足年龄的比值来表达结果——而一旦认知发展在成年期趋于平稳,这个公式就失去了意义。

韦克斯勒做了两项影响深远的改动。第一,他编制了一组彼此独立的分测验,每个测量不同的能力,让施测者看到的是一份剖面而不是孤零零一个数字。第二,他用离差智商取代了比率智商:分数表示的是一个人相对于同龄群体所处的位置,均值固定为 100,标准差固定为 15。今天几乎所有现代智力测验都沿用这一约定。

成人系列经历了数个版本的演变:

版本 出版年份 主要变化
韦氏—贝勒维 I 1939 首个韦氏成人测验组
WAIS 1955 更名并重新建立常模
WAIS-R 1981 更新常模与题目
WAIS-III 1997 在言语/操作智商之外引入四大指数
WAIS-IV 2008 取消言语与操作智商;四指数结构成为主体
WAIS-5 2024(美国) 指数结构调整;各国采用仍在推进中

其中影响最大的一步出现在 WAIS-IV:人们熟悉的言语智商与操作智商被彻底取消。数十年的因素分析研究表明,言语/非言语这种二分法过于粗糙,不足以描述成人认知的实际结构;取而代之的是以卡特尔—霍恩—卡罗尔(CHC)理论为依托的四指数模型。

关于版本时效需要说明一点:培生(Pearson)已于 2024 年在美国发布 WAIS-5,但各国的修订周期并不一致,WAIS-IV 的本地化版本在世界许多地区仍处于活跃的临床使用中。两个版本的底层逻辑是一致的,因此本文所述的结构依然直接适用。

2. 四大指数

WAIS-IV 把认知划分为四个宽泛的领域。每个指数由两到三个核心分测验合成,并采用与智商相同的量尺——均值 100、标准差 15。

指数 缩写 设计意图所测内容
言语理解指数 VCI 已习得的语言知识、词义、言语抽象推理
知觉推理指数 PRI 非言语问题解决、空间分析、基于视觉材料的流体推理
工作记忆指数 WMI 在短时间内保持并操作信息的能力
加工速度指数 PSI 在简单且高度熟练的视觉—动作任务上的速度与准确性

VCI 高度依赖晶体智力——通过教育、阅读和人生经验累积而成的知识。它也是在整个生命历程中保持得最好的一个指数。

PRI 更偏向对陌生视觉材料运用流体推理。由于对已存储知识的依赖较少,它对与年龄相关的变化更为敏感。

WMI 触及的是支撑推理、理解与学习的那块「心理工作台」。在注意力或专注度成为临床关注点的剖面中,工作记忆分数偏低确实较为常见,但单凭一个偏低的分数绝不构成任何诊断。

PSI 是四者中聚焦最窄的指数。它测量一个人完成常规视觉扫描与符号书写任务的速度,受动作速度、视力、疲劳与年龄的影响很大,通常也比其他三个指数更早、更快地出现下降。

3. 十五个分测验

WAIS-IV 共有 15 个分测验:10 个核心分测验用于构成总智商,5 个补充分测验提供额外的临床信息,或在某个核心分测验作废、无法施测时作为替代。

以下描述仅为任务类型的概括性说明。WAIS-IV 的实际题目属于受版权保护的保密测验材料,本站任何页面都不会复制这些内容。

分测验 所属指数 角色 任务类型(概括描述)
相似性 VCI 核心 说明两个概念在哪些方面相似
词汇 VCI 核心 解释所呈现词语的含义
常识 VCI 核心 回答一般知识性问题
理解 VCI 补充 解释日常规则与社会习俗
积木图案 PRI 核心 用彩色积木复现给定图案,计时
矩阵推理 PRI 核心 选出补全视觉规律的选项
视觉拼图 PRI 核心 判断哪些碎片可组成所示图形
图形推理 PRI 补充 通过数量推断解决视觉平衡问题
图画补缺 PRI 补充 找出图画中缺失的元素
数字广度 WMI 核心 顺序、倒序及按大小顺序复述数字串
算术 WMI 核心 心算应用题,计时
字母—数字排序 WMI 补充 将记住的字母与数字重新排序
符号检索 PSI 核心 限时在若干行中搜索目标符号
译码 PSI 核心 限时抄写与数字配对的符号
划消 PSI 补充 限时在干扰项中标出目标图形

其中两个补充分测验——图形推理与字母—数字排序——在标准施测中只建立到 69 岁的常模,这是该工具为老年人测评的现实情况所做的若干调整之一。

4. 分数是怎样一层层建立起来的

WAIS-IV 的计分要经过三个层级,理解这个阶梯是正确阅读报告的前提。

第一层——原始分。 每个分测验产出一个原始总分。原始分本身没有意义,既不能跨分测验比较,也不能跨人比较。

第二层——量表分。 每个原始分依据受测者所属年龄段的常模,换算为均值 10、标准差 3 的量表分。量表分 10 表示在该年龄组中恰好处于平均水平,13 高出一个标准差,7 低一个标准差,可用范围为 1 到 19。

第三层——合成分。 各指数内核心分测验的量表分求和后,换算为均值 100、标准差 15 的指数分。十个核心分测验的量表分合在一起,则在同一量尺上产生总智商(FSIQ)。

分数类型 均值 标准差 常见范围
分测验量表分 10 3 1 – 19
指数分(VCI、PRI、WMI、PSI) 100 15 约 40 – 160
总智商 FSIQ 100 15 约 40 – 160

报告中还常见两个附加合成分:

  • 一般能力指数(GAI)——仅由 VCI 与 PRI 构成,不含工作记忆与加工速度。当某种特定状况压低了 WMI 或 PSI,使 FSIQ 无法代表推理能力时,施测者会改用这一指数。
  • 认知效率指数(CPI)——与之镜像,由 WMI 与 PSI 构成,描述信息处理的效率。

WAIS-IV 的美国常模样本包含 2,200 名成人,按 13 个年龄段分层,并在性别、教育程度、族裔与地区上与人口普查数据匹配。其他国家会发布各自的修订版本与各自的常模样本——这正是为什么 WAIS-IV 分数始终是相对于某一特定人群而言的,而不是一个绝对量。

5. 实际施测是什么样子

WAIS-IV 不是一份可以自己填写的表格。它由具备资质的专业人员面对面、一次一名受测者地施测,通常是临床心理师、神经心理师或学校心理师,且必须接受过该工具的督导训练。

一次典型的施测通常包括:

  • 时长: 十个核心分测验约 60–90 分钟;若加上补充分测验、临床会谈与行为观察则更长。
  • 材料: 刺激图册、积木等实体教具、答题册、秒表与记录纸。
  • 标准化流程: 指导语须逐字宣读,起始题依年龄而定,每个分测验都有明确的回溯与终止规则,以免受测者被推到远超其上限的位置。
  • 质性观察: 施测者记录的不只是回答了什么,还包括怎么回答——犹豫、策略、自我更正、挫折耐受度。这是该工具临床价值的重要来源,也是任何自动化测验完全不具备的部分。

言语类分测验的评分需要受过训练的判断力。相似性、词汇与理解的回答按详细标准给 0、1 或 2 分,评分者之间的一致性取决于施测者的训练水平。这也是 WAIS-IV 属于受限工具、只向合格购买者销售的原因之一。

6. WAIS-IV 测得好的部分,以及它测不到的部分

技术文献报告的 WAIS-IV 信度相当高:FSIQ 的内部一致性系数通常在 .98 上下,指数分处于 .90 出头到中段,单个分测验则更低一些。短间隔的重测稳定性同样良好。以心理测量学的标准衡量,它属于心理学中验证最充分的工具之一。

但这仍然留下了清晰的边界。

它测量的是一组被界定过的能力,而不是整个心智。 言语知识、视觉推理、工作记忆与加工速度都很重要,但它们不是创造力、实务判断力、情绪调节、动机、社交能力或专业造诣。FSIQ 是对若干特定能力的有用概括,而不是对一个人价值或潜力的度量。

单一数字可能掩盖一份起伏很大的剖面。 FSIQ 为 105,可能来自四个指数都聚在 105 附近,也可能来自 VCI 128 搭配 PSI 82。这是两幅截然不同的认知图景,会引出完全不同的讨论。当指数之间差距明显时,多数施测者会认为 FSIQ 是个糟糕的概括,转而在指数层面进行解释。

分数带有测量误差。 WAIS-IV 报告一律附上置信区间,原因正在于此。观测到的 FSIQ 最好读作一条通常向上下各展开数分的区间的中点,而不是一个精确值。

表现依赖情境。 睡眠、疾病、用药、焦虑、疼痛、语言背景,以及与施测者之间的关系融洽程度,都会影响一次施测。称职的施测者会记录这些因素,并据此对结果作出限定性说明。

它本身不诊断任何东西。 WAIS-IV 剖面只是临床形成判断时的一项输入,此外还包括病史、会谈、旁证信息,往往还有其他工具。没有任何指数分数的组合构成对某种状况的诊断,把它当作诊断来解读就是对工具的误用。

7. 关于 WAIS-IV 的常见误解

「可以在网上做 WAIS-IV。」 不能。该工具需要面对面施测,配合实体材料、精确计时与施测者判断。任何以 WAIS-IV 名义出现在网络上的东西都不是 WAIS-IV——往好里说,只是一个借用了这个名字的无关测验。

「先练习分测验能更真实地反映能力。」 恰恰相反。对具体题目或任务形式的熟悉,会在底层能力毫无变化的情况下抬高后续分数——这是练习效应,属于测量假象。正因如此,施测者会遵守最短重测间隔,并在报告中注明此前的接触史。

「只有 FSIQ 这个数字重要。」 实务上,指数层面与分测验层面的形态往往比合成分携带更多临床信息。FSIQ 是解释的起点,而不是终点。

「WAIS-IV 分数一生不变。」 成年期测得的认知表现相对稳定,但并非一成不变。健康、感官功能、教育与正常老化都会使分数移动,其中加工速度的年龄相关变化尤其有充分记载。而在测量误差带内的波动,则完全不代表任何意义。

「WAIS-IV 分数高就保证成功。」 研究发现认知测验分数与学业成就、复杂工作表现等结果之间存在真实但中等的相关。这些都是群体层面的倾向,个体差异极大。没有任何分数能预测某一个人的人生。

常见问题

WAIS-IV 与 WAIS-5 有什么区别?

WAIS-5 于 2024 年在美国出版,更新了常模、修订了部分分测验,并重组了指数结构——最显著的是把视觉空间能力与流体推理分开,这一改动此前已在儿童量表上实施。由于各国修订版本各按自己的时间表推进,WAIS-IV 在国际上仍被广泛用于临床。两个版本都建立在同样的离差智商框架和同样的基本解释逻辑之上。

做一次 WAIS-IV 需要多长时间?

由经验丰富的施测者施测,十个核心分测验一般需要 60 到 90 分钟。若再加上补充分测验、临床会谈与计分,一次完整的评估预约可能延长到两小时以上。老年受测者、有注意困难的人,以及用第二语言应答的人往往需要更久;好的施测者会把握节奏,宁可让作答保持有效,也不会为赶时间而催促。

谁有资格施测 WAIS-IV?

施测资格限于取得认可资质、并接受过个别认知评估督导训练的专业人员,依各国法规通常为临床心理师、神经心理师或学校心理师。出版方只向合格购买者销售材料。这一限制既是为了保护测验的保密性,也因为有效的施测与计分确实需要训练。

WAIS-IV 多少分算好?

量表的设计使 100 成为受测者所属年龄组的中位数,约三分之二的人落在 85 到 115 之间。不存在某个门槛能让分数在绝对意义上算「好」——临床上真正重要的是各指数之间的形态、每个分数周围的置信区间,以及结果与当初提出评估需求的那个问题之间的关系。

为什么我的四个指数分差距这么大?

指数之间参差不齐很常见,而且往往是报告中信息量最大的部分。不同指数触及的确实是不同的能力,很少有人在四个方面同样强。较大的落差可能反映的只是一份普通的个人剖面,也可能与感官因素、语言背景、疲劳或某种具临床意义的形态有关。只有掌握完整病史、亲自完成评估的专业人员,才能判断属于哪一种。

在线认知测验与 WAIS-IV 相比如何?

两者无法直接相比。WAIS-IV 在标准化条件下个别施测,依据具全国代表性的常模计分,并结合临床病史进行解释。在线测验——包括 Brambin 的测验——在无人监督、条件不受控、缺乏经临床验证的常模样本的情况下进行。在线结果可以有趣,也可以引发有价值的自我反思,但它既不能替代专业施测的韦氏分数,也不是对该分数的估计。

小结

WAIS-IV 是一件经过精心工程化的工具:十五个分测验汇入四大指数,四大指数汇入总智商,全部以参照同龄常模样本的离差量尺表达。它在 2008 年的重构——舍弃言语与操作智商,改用言语理解、知觉推理、工作记忆与加工速度——正是数十年因素分析研究对成人认知实际组织方式的回应。

它的长处是真实的,它的限度同样真实。它以出色的信度测量一组特定且界定明确的能力;它测不到构成一个人能力的全部,也不作诊断。阅读一份 WAIS-IV 报告最有用的方式,是把它看作一份对认知强项与弱项的结构化描述——一份带有误差棒的剖面,产生于某一天、某一位施测者、某一个特定目的。


Brambin 提供一个面向自我了解与娱乐的八维认知剖面。它不是临床工具,与任何测验出版方均无隶属关系,也不等同于 WAIS-IV 或任何其他由专业人员施测的评估。请将任何在线分数——包括我们的分数——视为好奇心的起点,而不是临床判决。若需要正式的认知评估,请咨询具备资质的心理专业人员。

想了解更多?

下载Brambin,体验8种认知挑战和详细的分数分析。

下载Brambin
下载应用