seegongsik
내 단어장
확률과 통계

귀무가설을 세우고 놀라움을 잰다

귀무가설이 맞다고 가정하고, 관측이 얼마나 놀라운지를 p값으로 재요. p값이 유의수준보다 작으면 귀무가설을 기각해요. 1종 오류는 헛경보, 2종 오류는 놓침이고, 검정력은 놓치지 않을 확률이에요.

실험을 해서 신약이 효과가 있어 보이거나 새 알고리즘이 더 빨라 보여도, 그것만으로는 확신할 수 없다. 우연히 그렇게 나왔을 수도 있기 때문이에요. 그래서 통계는 법정처럼 움직인다. 먼저 아무 효과도 없다는 회의적인 기본 입장, 곧 귀무가설 H0를 세운다. 그리고 묻는다. 정말 H0가 참이라면 지금 우리가 본 데이터가 나올 일이 얼마나 드문가. H0가 참인데도 이 정도 결과가 나올 확률이 아주 작다면 H0를 유지하기가 어색해지고, 그래서 H0를 기각하고 대립가설 H1을 받아들여요. 핵심은 데이터가 참을 증명하는 게 아니라, 우연으로 설명하기엔 너무 놀라운지를 재는 것이다. 앞 강에서 표본평균이 어떻게 흩어지는지, 그 흩어짐으로 참값 범위를 어떻게 잡는지 봤다. 이번에는 같은 종 모양을 놀라움을 재는 자로 쓴다.

첫걸음은 두 가설을 명확히 세우는 것이다. 귀무가설 H0는 언제나 등호로, 아무 차이도 없다고 못 박아요(예: 평균 = μ0). 대립가설 H1은 우리가 보이고 싶은 주장이다. H1은 세 가지 모양이 가능한데, 한쪽으로 크다(오른쪽), 한쪽으로 작다(왼쪽), 아니면 그냥 다르다(양측)이다. 슬라이더로 H1의 중심을 H0에서 떨어뜨리고 토글로 방향을 고르면 된다. H0의 종에서 색칠된 꼬리가 곧 놀라운 결과가 떨어질 자리예요. 양측이면 양쪽 꼬리, 한쪽 검정이면 한쪽 꼬리만 본다. 어느 쪽을 의심하는지는 데이터를 보기 전에 미리 정해야 공정하다.

가설을 세웠으면 데이터를 하나의 숫자로 요약해 H0의 종 위에 올려놓아야 한다. 그 숫자가 검정통계량이다. 여기서는 표본평균 x̄를 표준화한다. z = (x̄ − μ0) / SE. 뜻은 간단해요. 관측된 평균이 H0의 기준값 μ0에서 표준오차 SE 몇 개만큼 떨어졌는가. SE는 앞 강의 표집분포 폭, 곧 σ/√n이다. 슬라이더로 관측 평균을 바꾸면 z가 표준정규 종 위에서 움직인다. z가 0 근처면 H0와 잘 맞고, z가 크면(2, 3처럼) 중심에서 멀리 벗어난 드문 자리로 간다. 이렇게 어떤 단위의 데이터든 z 하나로 바꾸면 모두 같은 표준 종 위에서 비교할 수 있어요.

이제 놀라움을 숫자로 바꾼다. p값은 H0가 참이라고 가정했을 때, 지금 관측된 것만큼 또는 그보다 더 극단적인 결과가 나올 확률이에요. 그림에서는 H0의 종 아래, 관측 통계량 바깥쪽 꼬리 넓이다. 슬라이더로 관측값을 바깥으로 밀수록 꼬리가 얇아지고 p가 작아진다. p가 작다는 건 H0가 참인 세상에서는 이런 데이터가 좀처럼 안 나온다는 뜻이라 그만큼 놀라운 것이다. 한 가지만은 꼭 짚어야 해요. p값은 H0가 참일 확률이 아니라, 어디까지나 H0를 참이라 가정한 조건부 확률이다. 이 방향을 헷갈리면 통계를 완전히 잘못 읽게 된다.

얼마나 작아야 충분히 작은 걸까요? 그 기준선을 미리 정한 것이 유의수준 α다. 흔히 0.10, 0.05, 0.01을 쓴다. α는 H0의 종에서 기각역, 곧 H0를 버릴 만큼 극단적인 꼬리 영역의 넓이이고 그 경계값이 임계값 z*이에요. 규칙은 간단하다. 관측 통계량이 임계값을 넘으면, 곧 p < α이면 H0를 기각하고 못 넘으면 기각하지 못한다. 토글로 α를 바꾸면 임계선이 움직이고, 슬라이더로 관측값이 그 선을 넘나들 때 판정이 뒤집힌다. α를 작게 잡을수록 기각의 문턱이 높아져 어지간히 놀랍지 않으면 H0를 못 버려요. 그러니까 α는 우리가 감수할 헛경보의 비율을 미리 정하는 손잡이다.

판정에는 두 가지 실수가 숨어 있다. 제1종 오류는 사실 H0가 참인데도 기각하는 것, 곧 헛경보이고 그 확률이 바로 α이며 H0 종에서 임계값 바깥 넓이예요. 제2종 오류는 사실 H1이 참인데 H0를 못 버리는 것, 곧 놓침이고 그 확률이 β이며 H1 종에서 임계값 안쪽 넓이다. 토글로 두 오류를 번갈아 보고 슬라이더로 진짜 효과크기를 키우면 흐름이 잡힌다. 효과가 클수록 H1 종이 오른쪽으로 멀어져 β가 줄고 검정력(1 − β)이 커져요. 검정력은 정말 효과가 있을 때 그것을 제대로 잡아낼 확률이다. α를 줄이면 헛경보는 줄지만 β가 늘어 놓침이 많아지는 맞교환이 있다. 그래서 표본을 늘려 SE를 줄이는 것이 두 오류를 동시에 줄이는 정공법이에요.

빠른 적용가설검정의 흐름은 이렇다. 아무 효과 없다는 귀무가설 H0와 보이고 싶은 대립가설 H1을 세우고, 양측인지 한쪽인지도 미리 정한 다음, 데이터를 검정통계량 z = (x̄ − μ0)/SE로 요약해요. 그다음 H0가 참이라 가정하고 그만큼 극단적인 결과가 나올 확률 p값을 잰다. p가 미리 정한 유의수준 α보다 작으면 H0를 기각하고, 아니면 기각하지 못한다. 이때 두 오류가 따라오는데, 헛경보인 제1종 오류(확률 α)와 놓침인 제2종 오류(확률 β)이고, 검정력 1 − β는 효과가 크고 표본이 많을수록 커져요. 딱 두 가지만 남기면 된다. p값은 H0가 참일 확률이 아니라 H0를 가정한 조건부 확률이고, 기각하지 못했다고 H0가 참으로 증명된 것은 아니다. 통계는 증명이 아니라 놀라움을 재서 결정을 내리는 언어다.
확률과 통계
이 페이지가 도움 됐다면 후원하기