왜 그런가요
새 검사가 질병을 얼마나 잘 찾는지 연구한다고 해 봅시다. 그런데 ‘실제로 질병이 있다’는 최종 판정에 그 새 검사 결과가 그대로 들어갑니다. 검사를 평가할 정답이 평가 대상의 답을 참고해 만들어진 셈입니다. 이런 구조는 검사의 정확도를 공정하게 평가하는 데 문제를 만들 수 있습니다.
검사 두 개보다 역할 두 개를 구별하기
진단연구에서는 평가하려는 검사를 지표검사라고 하고, 질병 유무를 판단하는 비교 기준을 참조표준이라고 부릅니다. Oxford의 편향 목록과 York 대학의 체계적 문헌고찰 지침은 지표검사 결과가 참조표준에 포함되는 문제를 통합 편향(incorporation bias)으로 설명합니다.
학습용 가상 기준을 보겠습니다. 새로운 혈액검사 양성이 ‘질병 있음’ 판정 조건의 하나입니다. 같은 혈액검사가 질병을 잘 찾는지 다시 계산하면 양성 결과가 기준 진단과 더 일치하도록 구조가 짜일 수 있습니다. 숫자가 소수점까지 제시됐어도 비교의 독립성이 확보됐다는 뜻은 아닙니다.
민감도 공식만 외우면 빠지는 질문
민감도와 특이도를 올바르게 계산하는 일과 믿을 만한 자료에서 계산하는 일은 다릅니다. 통합 편향은 정확도 추정치를 왜곡할 수 있습니다. 다만 모든 상황에서 항상 같은 방향과 크기로 변한다고 단정하지 않습니다. Oxford의 설명도 여러 조건에서 추정에 미치는 영향을 구별합니다.
참조표준이 현실적으로 완벽하지 않을 수도 있습니다. 중요한 것은 결과를 어떤 기준으로 정했는지 투명하게 보고, 평가할 검사 결과가 그 판정에 포함되는지 살피는 것입니다. 논문에서 참조표준 이름만 보고 확인을 끝내지 말고 구성 요소와 판정 절차를 읽습니다.
한 줄짜리 방법 절을 확장해 읽기
“전문가 최종 진단을 기준으로 했다”면 전문가가 어떤 자료를 보았는지 질문합니다. 평가할 검사 결과를 진단 조건에 넣었는지와, 다른 검사 결과를 해석할 때 미리 알고 있었는지는 관련되지만 다른 편향입니다. 통합과 눈가림 부족을 같은 이름으로 묶지 않습니다.
이 글은 진단연구를 읽는 연습이며 환자의 검사를 임의로 무효화하는 안내가 아닙니다. York의 오래된 지침은 이 안정적인 개념의 설명에 사용했으며, 그 안의 과거 평가도구를 최신 도구로 소개하지 않습니다. 정확도 표 앞에 ‘정답은 어떻게 만들어졌나?’를 적으면 공식 뒤의 설계가 보입니다.