왜 그런가요
가상 논문에서 젊은 군은 ‘통계적으로 유의’, 나이 든 군은 ‘유의하지 않음’으로 보고되었다. 그렇다면 치료는 젊은 사람에게만 효과가 있다고 결론 내릴 수 있을까? 각 군에서 효과가 없다는 가설을 검정한 결과와 두 군의 효과가 서로 같은지를 검정한 결과는 다르다. 꼬리표 두 개를 비교하는 것으로 두 번째 질문에 답할 수 없다.
먼저 답을 고르고 설명을 펼친다
유의와 비유의가 나뉘면 군간 차이는 이미 증명된 것 아닌가?
아니다. 표본 수와 추정의 정밀도가 달라 유의성 표시가 다를 수 있다. 두 군의 효과 차이는 적절한 상호작용 검정으로 평가해야 한다. 한쪽의 P값만 보거나 두 P값의 크기를 직접 비교하는 방식이 그 검정을 대신하지 않는다.
두 신뢰구간이 겹치는지만 보면 충분한가?
그 역시 공식적인 차이 검정을 대체하지 못한다. 같은 효과 척도에서 추정치와 불확실성을 읽고, 연구가 실제로 어떤 군간 비교를 했는지 확인한다.
본문과 하위군 그림의 질문이 다르다
Cochrane은 하위군 차이를 정식으로 검정해야 하며 유의한 결과와 유의하지 않은 결과를 나란히 놓아 차이라고 해석하지 않도록 설명한다. Altman과 Bland의 BMJ 원저도 서로 다른 P값이 반드시 유의한 상호작용을 뜻하지 않음을 보여 준다. 학생은 그림의 별표보다 방법 절에 상호작용 평가가 있는지 먼저 찾을 수 있다.
공식 검정이 있었다고 해서 개인별 치료 선택이 자동으로 완성되는 것도 아니다. 하위군이 미리 정해졌는지, 여러 군을 찾아본 탐색 결과인지, 임상적으로 납득할 이유가 있는지 확인한다. 많은 비교 중 눈에 띈 하나를 확정된 예외처럼 말하면 우연한 차이를 과장할 위험이 있다.
초록의 한 문장을 고쳐 쓰기
“한 군에서만 유의하므로 그 군만 효과가 있다” 대신 “각 군의 유의성 표시는 달랐지만, 군간 효과 차이의 검정과 추정치를 확인해야 한다”라고 적어 보자. 이 문장은 치료를 부정하는 것이 아니라 아직 답하지 못한 질문을 표시한다. 결과 해석과 환자 처방 사이에 필요한 증거를 남기는 연구 읽기 습관이다.