왜 그런가요
가상 예측모형이 높은 AUC를 보였고 어느 환자에게 위험도 20%를 제시했다고 합시다. AUC가 높다는 이유만으로 그 20%가 실제 발생 가능성을 정확히 말한다고 결론 내릴 수 있을까요? 사람을 위험 순서로 잘 세우는 능력과, 표시한 확률이 실제 발생 빈도와 맞는 능력은 다릅니다. 모델의 성능표에서 이 두 질문을 따로 확인해야 합니다.
성능 숫자가 답하는 질문
| 평가 측면 | 핵심 질문 | 그것만으로 알 수 없는 것 |
|---|---|---|
| 판별, 예를 들어 AUC | 사건이 생긴 사람을 그렇지 않은 사람보다 높은 위험 순서에 놓는가? | 위험도 20%라는 절대 확률이 실제 빈도와 맞는지는 보장하지 않습니다. |
| 보정 | 예측한 확률과 관찰된 발생이 일치하는가? | 보정 하나만으로 모든 환자의 순위 판별이나 임상 유용성을 보장하지 않습니다. |
순위는 맞고 확률은 높게 잡을 수 있습니다
설명용 가상 자료에서 위험도 20%로 예측된 비슷한 사람 100명 중 실제 사건이 10명에게 생겼다고 해 봅시다. 이 집단에서는 예측 20%와 관찰 10%의 차이를 살펴볼 이유가 있습니다. 이는 한 사람의 결과를 확정하는 계산도, 표본 변동을 무시한 최종 보정 판정도 아닙니다. 충분한 자료와 적절한 평가가 필요하다는 뜻입니다.
BMC Medicine의 원저는 좋은 판별 성능과 나쁜 보정이 함께 나타날 수 있다고 설명합니다. 같은 순위를 유지하면서 모든 확률을 지나치게 높게 제시해도 판별 성능이 좋아 보일 수 있습니다. 그래서 AUC만 보고 상담에 쓸 확률의 신뢰성을 판단하면 안 됩니다.
어디에서 검증했는지도 묻습니다
NICE의 예측모형 검토 안내는 개발 자료에서 보이는 성능이 낙관적일 수 있어 검증을 확인해야 한다고 설명합니다. 내부 검증과 다른 자료의 외부 검증은 목적이 다릅니다. 다른 병원·시기의 환자 구성과 측정 방식이 바뀌면 현재 환경의 성능도 달라질 수 있습니다. 개발 당시 AUC 한 개로 국내 모든 기관의 사용을 정당화하지 않습니다.
환자에게 전달할 위험도는 조건부입니다
적용 대상, 예측하려는 사건과 기간, 외부 검증, 보정 결과와 임상 활용 근거를 함께 확인합니다. ‘위험 순서가 잘 맞는다’는 결과와 ‘당신의 확률은 정확히 이 값이다’라는 말 사이를 구별하세요. 실제 의사결정에서는 수치 하나뿐 아니라 환자 상태와 선택의 이익·해까지 필요합니다.