지식

레이븐 매트릭스 검사: 언어가 필요 없는 비언어 IQ 검사

레이븐 누진행렬(Raven's Progressive Matrices)은 심리학에서 가장 널리 알려진 비언어 추리 검사입니다. 추상적인 도형이 채워진 격자에서 한 칸이 비어 있고, 그 자리에 들어갈 조각을 고르는 것이 전부입니다. 문장도, 계산도, 상식도 필요하지 않습니다. 1938년에 처음 출판된 이 검사는 지금도 연구, 채용 선발, 다국어 환경의 평가에 쓰이며, 현대 지능검사 대부분에 들어 있는 행렬추리 소검사의 직계 조상이기도 합니다. 이 글에서는 이 검사가 어디에서 왔고, 문항이 어떻게 만들어지며, 무엇을 재고 무엇은 재지 못하는지, 그리고 그 점수를 어떻게 읽어야 하는지를 정리합니다.

1. 레이븐 매트릭스는 어디에서 시작되었나

이 검사를 만든 사람은 영국의 심리학자 **존 C. 레이븐(John C. Raven)**으로, 첫 판은 1938년에 나왔습니다. 레이븐은 지적장애의 기원을 다룬 **라이오넬 펜로즈(Lionel Penrose)**의 연구에서 조수로 일했고, 문해 수준과 학교 교육 경험이 제각각인 사람들을 현장에서 빠르게 평가할 수 있는 도구가 필요했습니다. 당시의 검사들은 어휘, 일반 상식, 언어로 된 지시에 크게 의존했고, 그런 도구는 환경이 바뀌면 곧바로 무너졌습니다.

이론적 출발점은 **찰스 스피어만(Charles Spearman)**이었습니다. 스피어만의 2요인설은 모든 인지 과제에 공통으로 흐르는 일반요인(g)을 상정했고, 그는 이를 '관계와 상관항의 도출(eduction of relations and correlates)'이라는 말로 설명했습니다. 사물들이 서로 어떻게 연결되는지 파악하고, 그 관계를 새로운 사례로 확장하는 정신 작용입니다. 레이븐은 바로 그 작용만을 순수하게 끌어내도록 행렬 문항을 설계했습니다.

그는 이 검사를 어휘 검사(밀힐 어휘 척도)와 짝지어 사용했습니다. 어휘 검사는 그가 **재생적 능력(reproductive ability)**이라 부른 것, 즉 학습해 저장해 둔 정보를 꺼내 쓰는 힘을 재고, 행렬 검사는 도출적 능력(eductive ability), 즉 정해진 의미가 붙어 있지 않은 재료에서 스스로 의미를 만들어 내는 힘을 잽니다. 둘을 함께 봄으로써 하나의 숫자가 아니라 양면의 그림을 얻는다는 발상이었고, 이는 오늘날 유동지능과 결정지능의 구분으로 이어집니다.

이 검사의 수명은 이례적입니다. 1930년대에 만들어진 심리검사 중 90년 가까이 지난 지금도 상업적으로 출판되고 규준이 갱신되는 도구는 극히 드뭅니다.

2. 행렬 문항은 실제로 어떻게 생겼나

레이븐의 문항은 저작권으로 보호되므로 여기에 실제 문항을 옮기지는 않습니다. 다만 구조 자체는 공개된 지식이며 설명하기 어렵지 않습니다.

전형적인 문항은 추상적인 도형으로 이루어진 행렬을 보여 줍니다. 흔히 3 × 3 격자이고, 쉬운 세트에서는 2 × 2나 한 줄짜리 배열을 쓰기도 합니다. 오른쪽 아래 칸이 비어 있고, 행렬 아래에는 보통 여섯 개나 여덟 개의 후보 조각이 놓입니다. 빈칸에 들어갈 조각을 고르는 것이 과제입니다.

설계상 중요한 특징이 몇 가지 있습니다.

  • 언어가 필요 없습니다. 필요하면 지시를 몸짓으로도 전달할 수 있고, 문항 자체에는 글자가 없습니다.
  • 사전 지식이 도움이 되지 않습니다. 화살표, 점, 빗금, 기하 도형 등은 임의로 선택된 것이며 문화적·교과적 내용을 담고 있지 않습니다.
  • 난이도가 '누진적'입니다. 아주 쉬운 문항에서 아주 어려운 문항으로 배열되어 있어, 앞쪽 문항이 사실상 뒤쪽 문항에 필요한 논리를 가르치는 역할을 합니다. 이름에 들어 있는 '누진(Progressive)'은 여기서 나왔습니다.
  • 오답이 체계적입니다. 틀린 선택지는 무작위가 아니라 규칙을 부분적으로만 적용한 결과입니다. 모양은 맞지만 명암이 틀린 것, 진행 규칙을 엉뚱한 속성에 적용한 것 등입니다. 어려운 문항에서 찍기가 잘 통하지 않는 이유가 이것입니다.

직접 만든 예를 들자면, 한 행에서 점의 개수가 왼쪽에서 오른쪽으로 하나씩 늘어나는 동시에 그 점들을 감싼 도형이 한 칸마다 90도씩 회전한다고 생각해 보십시오. 서로 독립적인 두 규칙이 동시에 작동하고, 빈칸은 둘 다 만족해야 합니다. 어려운 문항은 이런 규칙을 여러 겹으로 포갭니다.

3. 검사의 주요 버전

레이븐은 단일한 검사를 낸 것이 아닙니다. 행렬 검사는 서로 다른 능력 구간을 겨냥한 여러 도구의 묶음으로 존재하며, 어떤 판을 쓰는지는 대상자의 능력 구간이 결정합니다.

버전 약칭 문항 수 구성 대상
색채 누진행렬 CPM 36 12문항 3세트(A, Ab, B) 어린 아동, 고령자, 인지 저하가 있는 사람
표준 누진행렬 SPM 60 12문항 5세트(A–E) 일반 인구, 약 6세부터 성인까지
표준 누진행렬 플러스 SPM+ 60 12문항 5세트 SPM과 같은 범위, 천장효과를 줄이기 위해 문항 난도 상향
고급 누진행렬 APM 12 + 36 세트 I(연습), 세트 II(채점) 상위 능력 구간의 성인·청소년
레이븐 누진행렬 3판 Raven's 2 가변 디지털, 적응형 문항 선택 현대의 임상·직업 장면

CPM은 배경에 색을 넣어 어린 아동의 주의를 붙잡고 시각적 부담을 줄입니다. SPM은 흔히 '레이븐 검사'라고 할 때 떠올리는 고전적인 형태입니다. APM이 따로 만들어진 이유는 SPM이 분포의 위쪽을 압축해 버리기 때문입니다. 능력이 높은 성인이 너무 많이 천장에 걸려서, APM의 문항은 SPM의 가장 어려운 문항이 끝나는 지점에서 시작합니다.

피어슨이 2018년에 낸 개정판, 흔히 Raven's 2라 불리는 판은 검사를 디지털 컴퓨터 적응형 형식으로 옮겼습니다. 지금까지의 수행에 따라 다음 문항의 난이도가 정해지는 방식입니다. 적응형 시행은 더 적은 문항으로 비슷한 정밀도에 도달하며, 고정형 판이 갖는 천장·바닥 문제를 줄여 줍니다.

시행 시간은 보통 20~45분입니다. 레이븐 본인은 SPM을 시간 제한 없이 실시하려 했습니다. 속도가 아니라 추리력을 보는 검사라고 여겼기 때문입니다. 시간을 재는 방식은 이후에 일반화되었고, 그에 따라 점수가 반영하는 내용도 달라집니다.

4. 이 검사가 실제로 측정하는 것

요인분석 연구에서 레이븐 행렬은 **유동지능(Gf)**에 매우 높게 부하되고, 그것을 통해 g와도 강하게 연결됩니다. 심리측정 문헌에서는 단일 검사로서 일반지능을 가장 잘 대표하는 지표 중 하나로 꾸준히 언급되어 왔습니다. g의 간단한 대리 지표가 필요한 연구자들이 이 검사를 자주 집어 드는 이유입니다.

인지적으로 이 검사가 요구하는 것은 다음과 같습니다.

  • 규칙 귀납 — 소수의 사례에서 추상적 규칙성을 추론하는 능력.
  • 작업기억과 목표 관리 — 후보 규칙을 검증하는 동안 부분적으로 풀린 하위 목표 여러 개를 동시에 머릿속에 붙들고 있는 능력.
  • 관련 차원에 대한 주의 — 모양, 개수, 명암, 방향, 크기, 위치 등 여러 시각 속성 가운데 실제로 패턴을 실어 나르는 것이 무엇인지 판별하는 능력.

고전적인 인지 분석은 **카펜터·저스트·셸(Carpenter, Just & Shell, 1990)**의 연구입니다. 이들은 APM 수행을 상세히 모형화했고, 어려운 문항을 가르는 결정적 요소는 동시에 관리해야 하는 규칙의 개수와 작업기억에서의 목표 관리 부담이라고 결론지었습니다. 이들이 정리한 반복적으로 등장하는 규칙 유형은 다음과 같습니다.

규칙 유형 내용
행 내 불변 한 속성이 행 안에서는 그대로 유지되고 행이 바뀌면 달라짐
양적 쌍별 진행 한 속성이 행을 따라 일정한 폭으로 증가하거나 감소함
도형의 더하기·빼기 두 칸이 결합되거나 한 칸이 제거되어 세 번째 칸이 만들어짐
세 값의 분포 한 속성의 세 가지 값이 각 행과 각 열에 한 번씩 나타남
두 값의 분포 두 값이 나타나고 각 행에 하나는 비어 있음

이 목록이 함의하는 바에 주목할 필요가 있습니다. 이 검사는 좁은 의미의 '시각 능력'을 재는 것이 아닙니다. 부하가 걸린 상태에서 추상적 가설을 얼마나 효율적으로 만들고, 검증하고, 유지하는지를 재는 것입니다.

뇌영상 연구는 행렬추리 수행을 전두-두정 네트워크의 분산된 활동과 연관 지어 왔으며, 융과 하이어의 두정-전두 통합 이론(2007)이 이를 요약합니다. 다만 이런 발견은 수행의 상관을 기술할 뿐, '지능'을 뇌의 특정 지점에 위치시키는 것은 아닙니다.

5. '문화 공평'이라는 논점

레이븐 행렬은 흔히 '문화 자유(culture-free)' 또는 '문화 공평(culture-fair)' 검사로 불립니다. 앞의 표현은 틀렸고, 뒤의 표현도 잘해야 근사치입니다.

가장 눈에 띄는 문화적 장벽을 제거한 것은 사실입니다. 언어도, 어휘도, 교과 내용도, 특정 문화권의 사물도 등장하지 않습니다. 이는 실질적인 장점이며, 여러 언어권에 걸친 연구나 검사자와 수검자가 공통 언어를 갖지 않은 장면으로 이 검사가 널리 퍼진 이유이기도 합니다.

그러나 문화 감소는 문화 자유와 같지 않습니다. 수행은 여전히 사람들 사이에 고르게 분포하지 않은 요소들에 의존합니다.

  • 2차원 추상 도형에 대한 익숙함. 이는 대체로 학교 교육과 인쇄물·화면 자료에 대한 노출의 산물입니다.
  • 시험이라는 관습. 객관식 형식, 정답이 하나 있으리라는 전제, 시간에 쫓기며 혼자 조용히 푸는 방식 자체가 학습된 관습입니다.
  • 교육 연한. 교육의 내용과는 별개로, 학교를 다닌 기간 자체가 행렬 수행과 상관을 보입니다.

현대 심리측정학의 합의는 이렇습니다. 문화로부터 자유로운 검사는 존재하지 않으며, 레이븐 검사는 특정 편향의 원천을 상당히 줄여 주지만, 그 감소를 모든 집단 사이의 보편적 비교 가능성으로 부풀려 해석해서는 안 된다는 것입니다.

6. 레이븐 검사와 플린 효과

플린 효과 — 20세기를 지나며 인지검사 원점수 평균이 장기적으로 상승한 현상 — 는 다름 아닌 레이븐형 검사에서 가장 극적으로 관찰되었습니다. 제임스 플린을 비롯한 연구자들은 추상적 행렬추리에서의 상승 폭이 어휘나 상식 검사에서의 상승 폭보다 훨씬 크며, 일부 국가 자료에서는 한 세대에 표준편차 1에 이르는 규모였음을 확인했습니다.

이는 이 검사를 '문화 공평'하다고 읽는 관점에게 상당히 곤란한 결과입니다. 행렬 검사가 환경의 영향을 받지 않는 고정된 생물학적 용량을 잰다면, 세대가 바뀌면서 점수가 그렇게 가파르게 올라갈 이유가 없기 때문입니다. 유력한 설명은 오히려 환경의 변화를 가리킵니다. 길어진 교육 기간, 도표와 기호로 포화된 시각 환경, 그리고 플린 자신이 선호한 설명 — 구체적 범주 대신 추상적·가설적·분류적 범주를 습관적으로 사용하는 쪽으로 일어난 문화적 전환입니다.

여기서 두 가지 실질적 결론이 나옵니다. 첫째, 규준에는 유효기간이 있습니다. 같은 원점수라도 1979년 규준으로 읽을 때와 2018년 규준으로 읽을 때 결과가 다르고, 오래된 규준일수록 수검자에게 후하게 나옵니다. 둘째, 검사 평균이 올라간 것과 인구 전체가 모든 면에서 더 지적으로 되었다는 것은 같은 말이 아닙니다. 상승 폭이 인지 영역별로 크게 달랐다는 사실이야말로 이 발견에서 가장 많은 정보를 담고 있는 부분입니다.

7. 레이븐 검사의 점수는 어떻게 보고되나

원점수는 단순히 맞힌 문항 수입니다. SPM은 60문항 중, APM 세트 II는 36문항 중 몇 개를 맞혔는지입니다. 이 숫자 자체는 아무 의미가 없습니다. 해당 연령 집단과 모집단에 맞는 규준표와 대조되어 백분위로 변환될 때 비로소 해석이 가능해집니다.

일부 출판사는 백분위를 다시 평균 100, 표준편차 15의 표준점수 척도로 변환해, 웩슬러형 IQ 점수와 나란히 이야기할 수 있게 합니다. 다만 이 변환은 편의이지 등가가 아닙니다. 레이븐에서 나온 표준점수와 웩슬러 전체 IQ는 서로 다른 내용으로 구성되며 맞바꿔 쓸 수 없습니다.

레이븐에서 나온 어떤 수치에도 세 가지 주의가 따릅니다.

  1. 단일 영역 측정입니다. 행렬 검사는 유동적·비언어적 추리를 잽니다. 언어 이해, 축적된 지식, 처리 속도에 대해서는 아무것도 말해 주지 않습니다. 종합검사가 여러 영역을 표집하는 이유가 정확히 이것입니다.
  2. 측정 오차를 포함합니다. 다른 모든 검사와 마찬가지로 관측 점수는 추정치입니다. 잘 표준화된 점수의 95 % 신뢰구간은 보통 관측값 양옆으로 몇 점씩 펼쳐집니다.
  3. 연습은 사람이 아니라 점수를 바꿉니다. 행렬 문제를 많이 풀어 본 사람은 행렬 문제를 더 잘 풀게 됩니다. 그 향상은 문항 형식과 반복되는 규칙 유형에 익숙해진 결과, 즉 과제 특이적 학습이며, 기저의 일반 능력이 달라졌다는 뜻으로 읽어서는 안 됩니다.

8. 오늘날 행렬 문항을 만나게 되는 곳

레이븐 검사 자체를 한 번도 치르지 않더라도, 그 설계를 만나 본 적은 거의 확실히 있습니다. **행렬추리(Matrix Reasoning)**는 WAIS-IV와 WISC-V의 핵심 소검사입니다. 같은 형태의 도형 행렬 과제는 스탠퍼드-비네 검사, 카텔 문화공평검사, 나글리에리 비언어 능력검사, 각종 직업 적성검사, 그리고 인터넷에 떠도는 무료 검사 상당수에 들어 있습니다.

일부 국가의 고지능 단체 지부는 감독 하에 실시된 고급 누진행렬(APM) 점수를 입회 근거의 일부로 받아들여 왔습니다. 다만 기준은 나라마다 다르고 시간이 지나면서 바뀌므로, 그 경로를 생각하는 사람은 떠도는 목록에 의존하지 말고 해당 단체에 직접 현행 요건을 확인해야 합니다.

Brambin의 패턴 추리 문항을 포함한 온라인 행렬 검사들은 같은 논리를 사용하지만, 상표로 보호되는 레이븐 검사가 아니며 표준화된 조건에서 실시되지도 않습니다. 호기심과 자기이해에는 유용합니다. 임상 평가는 아니며 그것을 대신할 수도 없습니다.

자주 묻는 질문

레이븐 누진행렬은 IQ 검사인가요?

비언어적 유동추리를 재는 검사이며 일반지능과 매우 강하게 상관하고, 결과가 평균 100·표준편차 15의 IQ형 척도로 변환되는 경우도 많습니다. 다만 웩슬러 같은 종합검사가 다루는 여러 영역 중 하나만을 측정하기 때문에, 같은 척도 위에 인쇄되어 있더라도 레이븐 결과와 전체 IQ는 같은 양이 아닙니다.

검사에는 시간이 얼마나 걸리나요?

버전과 시행 방식에 따라 다릅니다. 표준 누진행렬(SPM)은 보통 20~45분이 걸리고, 집단으로 시간을 재어 실시할 때는 45분 제한이 흔합니다. 레이븐은 원래 속도가 아니라 추리력이 관심 대상이라고 보아 시간 제한 없이 설계했고, 일부 연구 장면에서는 지금도 무제한 시행이 사용됩니다.

레이븐 검사는 정말 문화의 영향을 받지 않나요?

그렇지 않습니다. '문화 자유'보다는 '문화 감소'라고 부르는 편이 정확합니다. 언어와 교과 내용을 걷어내면 큰 편향 원천 몇 가지는 사라지지만, 수행은 여전히 추상적 2차원 도형에 대한 익숙함, 학교 교육, 시험 관습에 의존하며 이 요소들은 환경에 따라 크게 다릅니다. 오늘날 대부분의 심리측정학자는 '문화 자유'라는 표현을 과장으로 봅니다.

연습하면 레이븐형 문제를 더 잘 풀게 되나요?

행렬 문제 수행은 연습으로 향상됩니다. 반복되는 규칙 유형이 익숙해지고 형식이 더 이상 낯설지 않게 되기 때문입니다. 연구가 지지하는 것은 이것이 과제 특이적 학습이라는 점입니다. 향상은 연습한 과제에서 나타나고 무관한 인지 과제로는 잘 전이되지 않습니다. 일반적 추리 능력이 달라졌다는 뜻으로 해석해서는 안 되며, 임상가들이 최근에 재실시한 검사의 점수를 낮게 취급하는 이유이기도 합니다.

왜 버전이 이렇게 여러 개인가요?

60문항짜리 한 가지 형식으로는 능력 범위 전체를 정확히 잴 수 없기 때문입니다. 색채판은 어린 아동이나 인지 저하가 있는 성인이 지나치게 어려운 검사의 바닥에 걸리지 않도록 존재하고, 고급판은 능력이 높은 성인이 지나치게 쉬운 검사의 천장에 걸리지 않도록 존재합니다. 최신 적응형 판은 수행에 따라 문항을 골라 줌으로써 두 문제를 한꺼번에 다룹니다.

실제 레이븐 문항은 어디에서 볼 수 있나요?

합법적으로 공개된 곳은 없습니다. 문항은 라이선스 하에 출판되는 저작물이고, 보안 자체가 중요합니다. 널리 유출된 문항은 규준을 만들 당시에 재던 것을 더 이상 재지 못하기 때문입니다. 형식을 흉내 낸 연습 자료는 있지만 그것은 검사가 아니며, 그 점수는 규준화된 레이븐 결과와 비교할 수 없습니다.

요약

레이븐 누진행렬이 1938년 이후 살아남은 것은 한 가지를 대단히 잘하기 때문입니다. 언어, 지식, 교과 내용에서 추상적 규칙 귀납만을 떼어 내는 일입니다. 그래서 이 검사는 이용 가능한 유동추리 지표 가운데 가장 순수한 축에 속하며, 이 분야에서 가장 널리 쓰이는 연구 도구 중 하나가 되었습니다.

한계 역시 분명합니다. 단일 인지 영역을 측정합니다. 문화 자유가 아니라 문화 감소 검사입니다. 규준은 흘러가며, 플린 효과는 그 사실을 다른 어떤 검사보다 이 검사에서 선명하게 보여 주었습니다. 그리고 여기서 나온 점수는 신뢰구간을 동반한 추정치이지 사람에게 고정된 속성이 아닙니다.

다른 근거와 함께 읽을 때 행렬추리 결과는 분명히 유익한 정보입니다. 단독으로, 판결처럼 읽을 때 그것은 애초에 감당하도록 만들어지지 않은 무게를 짊어지게 됩니다.


Brambin은 패턴 추리 문항을 포함한 8개 영역 인지 프로파일을 자기이해 목적으로 제공합니다. 레이븐 누진행렬 검사가 아니며, 그 출판사와 아무런 제휴 관계가 없고, 임상 평가도 아닙니다. 저희 것을 포함한 모든 온라인 점수는 판결이 아니라 호기심의 출발점으로 다뤄 주세요.

정식 테스트로 전체 점수를

무료 다운로드 · 정식 테스트는 1회성 인앱 구매, 구독 없음

Brambin 다운로드
앱 다운로드