공부 루틴
가상의 학습 평가다. 한 번의 모의시험에서 가장 낮은 점수를 받은 학생만 보충수업에 참여했다. 다음 시험에서 평균 점수가 올랐으니 보충수업의 효과가 입증된 것일까? 도움이 되었을 가능성과 이 비교만으로 효과가 확정됐다는 주장은 다르다. 선발 기준 자체가 재측정의 변화와 관계할 수 있다.
재측정에서 평균에 가까워지는 이유
한 번의 극단값으로 집단을 고르면 어떤 현상이 생길 수 있을까?
평균으로의 회귀다. 한 번 관찰한 값에는 개인의 비교적 안정된 특성과 그때의 우연한 변동이 함께 들어 있다. 매우 낮거나 높은 값으로 사람을 골랐다면 재측정 때 집단의 평균이 덜 극단적으로 나타날 수 있다. 모든 사람이 반드시 평균 점수가 된다는 뜻은 아니다.
중재 없이도 나타날 수 있는 변화
Bland와 Altman의 BMJ 통계 설명은 처음에 극단적인 측정값을 보인 집단이 이후 덜 극단적인 평균을 보일 수 있음을 다룬다. 따라서 극단값으로 선발한 뒤 얻은 변화 전부를 치료·교육 효과로 해석하면 오류가 생길 수 있다. 점수가 올랐다는 관찰은 실제지만 그 원인의 비중은 아직 확인되지 않았다.
Harvard Medical School 연구자들의 원 논문도 시간에 따라 변하는 변수의 극단값으로 집단을 선택할 때 평균으로의 회귀가 평가를 왜곡할 수 있음을 설명한다. 더 극단적으로 고르고 측정값이 불안정할수록 문제가 커질 수 있다. 이 글은 논문의 시뮬레이션 결과를 보충수업의 실제 효과 크기로 옮기지 않는다.
‘회귀라서 효과 없음’도 성급하다
평균으로의 회귀가 가능하다는 사실만으로 보충수업이 무효라고 결론 내리는 것도 틀리다. 실제 교육 효과와 측정 변동, 다른 변화가 함께 있을 수 있다. 효과를 평가하려면 선발 과정과 여러 시점의 자료, 적절한 비교를 검토해야 한다. 동일한 극단값으로 고른 대조군을 만들기만 하면 모든 문제가 해결된다는 단순 규칙도 아니다.
학습 보고서를 고친다면 “보충수업 후 점수 상승을 관찰했으나, 낮은 점수로 선발한 조건과 평균으로의 회귀를 고려해야 함”이라고 쓸 수 있다. 다음 질문은 “중재가 없었어도 얼마나 달라졌을까?”다. 자료를 하나 더 모으는 목적이 변화의 존재 확인인지 원인 확인인지 구별한다.
이 가상 사례는 실제 합격생 성과나 프로그램 효과를 보고하는 글이 아니다. 가장 낮은 점수를 고른 방식부터 읽으면 결과가 보기 좋다는 이유만으로 중재의 효과를 입증했다고 말하지 않게 된다.