왜 그런가요
교육용 가상 자료다. 두 프로그램 A와 B의 성공률을 비교했는데 쉬운 과제와 어려운 과제 각각에서는 A가 높고 전체에서는 B가 높다. 계산이 틀린 것일까? 층마다 들어간 사람 수가 다르면 이런 방향 반전이 가능하다. 다음 표는 실제 연구 결과가 아니라 직접 만든 산술 예시다.
| 과제 층 | A 성공/전체 | B 성공/전체 |
|---|---|---|
| 쉬운 과제 | 9/10 = 90% | 80/100 = 80% |
| 어려운 과제 | 60/100 = 60% | 5/10 = 50% |
| 전체 | 69/110 ≈ 62.7% | 85/110 ≈ 77.3% |
같은 비율을 평균낸 것이 아니다
A는 어려운 과제에 참여한 사람이 많고 B는 쉬운 과제에 참여한 사람이 많다. 각 프로그램의 전체 성공률은 자기 집단 구성으로 가중된 결과다. 층별 비율 두 개를 단순 평균한 값과 다르다. 그래서 각 층에서는 A가 높으면서 집계 결과에서는 A가 낮게 나타날 수 있다.
UC Berkeley의 실험·관찰연구 자료는 학과별 지원 구성과 전체 합격률의 관계로 심프슨 역설을 설명한다. Stanford Encyclopedia는 집단을 나눌 때 연관성이 나타나거나 사라지거나 반전되는 현상을 다룬다. 이 글은 그 사례의 실제 숫자를 복제하지 않고 방향 반전을 보여 주는 새 연습표를 사용했다.
층별 결과가 언제나 ‘진짜 답’은 아니다
전체와 층별이 다르면 유리한 쪽을 골라 발표하는 것이 아니라, 연구 질문과 층을 만든 변수의 역할을 확인한다. Stanford의 인과 해석은 그 변수가 공통 원인인지 중간 경로의 변수인지 같은 배경 지식에 따라 적절한 분석이 달라질 수 있음을 설명한다. 통계표만으로 어느 쪽이 인과 효과를 보여 주는지 자동 결정하지 않는다.
가상 표는 수학적 반전이 가능함을 보여 줄 뿐 프로그램 A의 효과가 입증됐다는 뜻은 아니다. 참여가 어떻게 결정되었고 무엇을 비교하려는지 정보가 더 필요하다. 국시와 보고서에서는 전체 비율의 분자·분모를 먼저 확인한 뒤 층별 구성 차이와 분석 목적을 질문하자. 모순처럼 보이는 결과를 발견했다고 계산 오류나 조작으로 바로 단정하지 않는다.