수학·컴퓨터

양성 판정이 나와도 병이 아닐 확률, 베이즈 정리

정확도 99%인 검사에서 양성이 나왔는데 실제로 병에 걸렸을 확률이 절반도 안 될 수 있다. 직관을 배신하는 이 계산의 뿌리인 베이즈 정리를 차근차근 따라가 본다.

편집부 · 2026년 10월 10일 · 읽는 데 4분

흰 책상 위에 놓인 검사 시험관과 확률 도표
흰 책상 위에 놓인 검사 시험관과 확률 도표

베이즈 정리는 새로운 증거를 얻었을 때 원래 가지고 있던 믿음을 얼마나 고쳐야 하는지를 계산하는 규칙이다. 18세기 영국의 목사이자 수학자 토머스 베이즈가 처음 다룬 이 식은, 오늘날 의료 진단과 스팸 메일 필터, 인공지능의 추론까지 폭넓게 쓰인다. 이 정리가 가장 극적으로 드러나는 장면은 드문 질병의 검사 결과를 해석할 때다. 검사의 정확도가 아무리 높아도, 병 자체가 드물면 양성 판정의 상당수가 틀린 경보가 될 수 있다.

정확도 99% 검사의 함정

어떤 질병이 인구 1,000명 가운데 1명꼴로 걸린다고 하자. 이 병을 찾는 검사는 환자를 99% 확률로 양성이라고 판정하고, 건강한 사람도 1% 확률로 잘못 양성이라고 판정한다. 누군가 이 검사에서 양성을 받았다면 실제로 병에 걸렸을 확률은 얼마일까. 많은 사람이 99%에 가까운 숫자를 떠올리지만, 실제 답은 약 9%에 불과하다.

이유는 사람 수로 바꿔 세어 보면 바로 보인다. 10만 명이 검사를 받는다고 하면, 실제 환자는 100명이고 이 가운데 99명이 양성을 받는다. 건강한 사람은 99,900명인데, 이 가운데 1%인 약 999명도 양성을 받는다. 양성을 받은 사람은 모두 1,098명이고, 그중 진짜 환자는 99명뿐이다. 양성 판정을 받은 사람 열한 명 가운데 한 명꼴로만 실제 환자인 셈이다.

구분 실제 환자 100명 건강한 사람 99,900명
검사 양성 99명 약 999명
검사 음성 1명 약 98,901명

많은 사람의 아이콘 가운데 소수만 색이 다른 확률 그림

사전 확률이 결과를 좌우한다

베이즈 정리의 핵심은 검사 전에 이미 알고 있던 확률, 곧 사전 확률을 계산에 반드시 넣어야 한다는 점이다. 위의 예에서 사전 확률은 0.1%였다. 검사라는 증거가 이 확률을 약 9%로 끌어올렸지만, 출발점이 워낙 낮아서 결과도 여전히 낮다. 사람들은 흔히 검사의 정확도만 보고 출발점을 잊는데, 이를 기저율 무시라고 부른다.

같은 검사라도 사전 확률이 달라지면 결과의 의미가 완전히 바뀐다. 증상이 뚜렷해 의사가 이미 병을 강하게 의심하는 환자라면 사전 확률이 30%쯤 될 수 있다. 이 사람이 같은 검사에서 양성을 받으면 실제로 병일 확률은 97%를 넘는다. 그래서 의사는 증상이 없는 사람 전체를 검사하는 선별 검사와, 의심 환자를 확인하는 확진 검사를 다르게 해석한다.

식으로 쓰면 어떻게 되나

베이즈 정리는 다음과 같이 쓴다. 증거 B를 본 뒤 가설 A가 참일 확률은, A가 참일 때 B가 나올 확률에 A의 사전 확률을 곱하고, 이를 B가 나올 전체 확률로 나눈 값이다. 기호로는 P(A|B) = P(B|A) × P(A) ÷ P(B)로 적는다. 분모의 P(B)는 병이 있을 때와 없을 때 양성이 나올 확률을 모두 더한 것이라, 앞의 표에서 양성 칸 전체를 합한 것과 같다.

식 자체는 단순하지만, 이 식이 말하는 태도는 깊다. 믿음은 한 번에 정해지는 것이 아니라 증거가 쌓일 때마다 조금씩 갱신된다. 첫 검사에서 양성을 받은 사람이 두 번째 독립적인 검사에서도 양성을 받으면, 첫 결과로 얻은 약 9%가 새로운 사전 확률이 되고, 이번에는 결과가 90%를 넘게 올라간다. 재검사가 왜 중요한지를 수학이 그대로 보여 주는 셈이다.

연필로 확률 식을 적어 내려간 공책

스팸 필터와 인공지능 속의 베이즈

베이즈 정리는 일상의 기술 곳곳에 숨어 있다. 초기의 스팸 메일 필터는 메일에 들어 있는 낱말을 증거로 삼아, 그 메일이 스팸일 확률을 계속 갱신했다. 특정 낱말이 스팸 메일에 자주 나오고 정상 메일에는 드물다면, 그 낱말이 보일 때마다 스팸일 확률이 올라간다. 여러 낱말의 증거를 차례로 곱해 나가면 메일 하나를 판정할 수 있다.

로봇이 자기 위치를 추정하거나, 자율주행차가 센서 정보로 주변 물체를 파악할 때도 같은 원리가 쓰인다. 센서는 늘 조금씩 틀리기 때문에, 이전에 추정한 위치를 사전 확률로 두고 새 측정값으로 계속 고쳐 나간다. 불확실한 정보를 다루는 거의 모든 분야에서 베이즈 정리는 생각의 기본 틀이 된다.

직관이 틀리는 이유를 아는 것의 가치

베이즈 정리가 알려 주는 가장 실용적인 교훈은, 놀라운 결과일수록 출발점부터 다시 따져 보라는 것이다. 드문 사건을 가리키는 증거는 아무리 정확해 보여도 틀린 경보를 많이 섞고 있을 수 있다. 법정에서 증거의 무게를 따질 때나, 뉴스 속 숫자를 해석할 때도 같은 함정이 반복된다. 확률을 비율이 아니라 실제 사람 수로 바꿔 세어 보는 습관만 들여도, 직관의 착각을 상당 부분 피할 수 있다.

이어서 읽기