어떤 통계 검정을 써야 할까
질문에 답하세요
무엇을 알고 싶나요?
각 그룹에서 무엇을 측정하나요?
몇 개의 그룹을 비교하나요?
두 측정이 같은 대상에서 나온 것인가요?
모든 조건에서 같은 대상을 측정하나요?
범주는 어떻게 구성되어 있나요?
표의 어떤 칸이든 기대빈도가 5 미만인가요?
두 변수는 어떤 종류인가요?
점들이 직선처럼 보이고 극단적인 이상치가 없나요?
예측하려는 변수는 어떤 종류인가요?
몇 개의 변수로 예측하나요?
일표본 t 검정
당신 그룹의 평균이 이미 알고 있던 값과 다른지를 묻습니다.
자료가 대체로 대칭인지 확인하세요. 그렇지 않다면 윌콕슨 부호순위 검정을 쓰세요.
독립표본 t 검정
서로 다른 두 그룹의 평균이 다른지를 묻습니다.
각 그룹이 대체로 대칭인지 확인하세요. 그렇지 않다면 만-휘트니 U 검정을 쓰세요.
대응표본 t 검정
같은 대상이 두 측정 사이에 변했는지를 묻습니다.
차이값이 대체로 대칭인지 확인하세요. 그렇지 않다면 윌콕슨 부호순위 검정을 쓰세요.
일원배치 분산분석
세 개 이상의 그룹 중 적어도 하나가 다른지를 묻습니다.
어떤 그룹이 다르다는 것만 알려줄 뿐 어느 것인지는 알려주지 않으므로, 다음에 사후비교를 합니다. 자료가 대칭이 아니면 크러스컬-월리스 검정을 쓰세요.
반복측정 분산분석
같은 대상이 세 개 이상의 조건에 걸쳐 변했는지를 묻습니다.
구형성을 확인하고, 위배되면 보정하세요. 순위 기반 대안은 프리드먼 검정입니다.
카이제곱 적합도 검정
관측한 빈도가 기대한 비율과 맞는지를 묻습니다.
범주가 둘뿐이고 사례가 적다면 정확 이항검정이 더 안전합니다.
카이제곱 독립성 검정
두 범주형 변수 사이에 연관이 있는지를 묻습니다.
연관이 있다는 것만 말할 뿐 얼마나 강한지는 말하지 않습니다. 크라메르의 V 같은 효과크기를 함께 보고하세요.
피셔의 정확검정
카이제곱과 같은 질문에 답하지만, 빈도가 작아도 여전히 타당합니다.
기대빈도가 5 미만으로 떨어질 때마다 쓰세요. 바로 그 지점에서 카이제곱은 믿을 수 없게 됩니다.
맥니마 검정
같은 대상이 두 시점 사이에 범주를 바꿨는지를 묻습니다.
정보를 담는 것은 변한 대상뿐이며, 그대로인 대상은 검정에 들어가지 않습니다.
피어슨 상관
두 수치 변수가 직선 관계에 얼마나 가까운지를 잽니다.
상관은 인과가 아니며, 이상치 하나가 상관을 만들거나 없앨 수 있습니다. 숫자를 믿기 전에 점을 그려 보세요.
스피어만 상관
한 변수가 오를 때 다른 변수도 오르는지를, 직선을 요구하지 않고 잽니다.
순위를 사용하므로 이상치에 강하고 순서 척도에도 맞습니다.
단순선형회귀
한 숫자로 다른 숫자를 가장 잘 예측하는 직선을 긋습니다.
잔차를 보세요. 아무 패턴도 없어야 합니다. 잔차가 휘어 있다면 직선이라는 형태가 틀린 것입니다.
다중선형회귀
여러 변수로 동시에 한 숫자를 예측합니다.
예측변수들이 서로 같은 말을 하고 있지 않은지 확인하세요. 계수가 부풀고 불안정해집니다.
로지스틱 회귀
예 또는 아니오라는 결과의 확률을 예측합니다.
계수는 오즈비이지 확률의 차이가 아닙니다. 둘을 혼동하는 것이 흔한 실수입니다.
다항 로지스틱 회귀
관측이 순서 없는 여러 범주 중 어디에 속하는지를 예측합니다.
모든 결과는 기준 범주에 대비해 읽습니다. 어느 것을 골랐는지 밝히세요.
순서형 로지스틱 회귀
순서 척도 위의 위치를 예측하며, 모형 안에 순서를 유지합니다.
효과가 척도의 모든 분할점에서 같다고 가정합니다. 보고하기 전에 그 가정을 검정하세요.
포아송 회귀
어떤 기간이나 장소에서 어떤 일이 몇 번 일어나는지를 예측합니다.
분산이 평균과 같다고 가정합니다. 분산이 훨씬 크면 음이항 회귀를 쓰세요.
내 자료가 t 검정을 하기에 충분히 정규인지 어떻게 알 수 있나요?
먼저 그려 보세요. 히스토그램이나 상자 수염 그림이 어떤 검정보다 빨리 답을 줍니다. 중요한 것은 완벽한 정규성이 아니라 형태가 대체로 대칭이고 극단적인 이상치가 없는지입니다.
t 검정은 표본이 커질수록 관대해집니다. 백 개일 때의 가벼운 비대칭은 거의 문제가 되지 않지만, 여덟 개일 때의 같은 비대칭은 문제입니다. 헷갈리면 순위 기반 방법도 함께 돌려 보세요. 둘이 일치하면 선택은 상관없었던 것입니다.
모수 검정과 순위 기반 검정의 차이는 무엇인가요?
모수 검정은 값 자체를 사용하며 보통 정규곡선에 가까운 형태를 가정합니다. 순위 기반 검정은 값을 버리고 순서만 남기므로 이상치가 더 이상 문제가 되지 않습니다.
대가는 순위 기반 검정이 약간 다른 질문에 답하며, 모수 검정의 가정이 실제로 성립할 때는 검정력이 낮다는 점입니다. 어느 쪽도 더 안전한 기본값이 아니라, 서로 다른 상황에 대한 답입니다.
검정이 유의하게 나왔습니다. 그러면 효과가 큰 건가요?
아니요. p 값은 결과가 우연으로 설명하기 어려운지에 답합니다. 표본이 충분히 크면 아주 작은 차이도 우연으로 설명하기 어려워집니다.
효과크기를 함께 보고하고, 가능하면 신뢰구간도 덧붙이세요. 크기는 그 차이가 중요한지를 알려주지만, p 값은 그것이 아마 잡음이 아니라는 말만 합니다.
이것이 통계를 아는 사람에게 묻는 일을 대신하나요?
아니요, 그럴 생각도 없습니다. 당신 질문의 형태에 맞는 선택을 가리키고, 쓰기 전에 확인할 가정을 알려줄 뿐입니다.
실제 자료에는 순서도가 볼 수 없는 것들이 따라옵니다. 결측값, 여러 번 측정된 대상, 크기가 크게 다른 그룹, 결과를 본 뒤에 고른 변수. 그중 어느 것이든 답을 바꿀 수 있습니다.
반응
0
0 코멘트
첫 댓글을 남겨보세요