도구스학업·수학

크루스칼-왈리스 H 검정 계산기

세 집단 이상을 정규성 가정 없이 비교하는 H 검정을 계산합니다. 동점 보정을 적용한 H와 보정 전 H를 나란히 보여 주어, 보정을 빠뜨리면 결론이 어떻게 달라지는지 확인할 수 있습니다.

3개 집단, 값 18개를 읽었습니다. 입력한 값은 서버로 전송되지 않습니다.

H 통계량

2.8538

자유도 2 · 양측 p = 0.2401 · 유의수준 5%에서는 차이가 있다고 보기 어렵습니다

H (동점 보정 후)2.853801
H (보정 전)2.853801
동점 보정 계수 C1 (동점 없음)
자유도2 (집단 수 − 1)
p 값0.240052
전체 자료 수 N18
효과크기 ε²0.1679

집단별 순위

집단n순위 합평균 순위중앙값범위
1번째 줄6396.582 ~ 27
2번째 줄66510.8320.58 ~ 36
3번째 줄66711.1726.53 ~ 34

평균 순위가 집단마다 비슷하면 H가 작고, 한 집단이 위쪽 순위를 몰아 가지면 H가 커집니다. 순위 합을 모두 더하면 N(N+1)/2 = 171이 됩니다.

계산 근거H = 12/(N(N+1)) · Σ(Rᵢ²/nᵢ) − 3(N+1) = 2.853801동점이 없어 보정 계수 C = 1 · 자유도 2 카이제곱 → p = 0.240052
«어딘가 다르다»까지만 말해 줍니다 — 어느 집단끼리인지는 알려 주지 않습니다. H가 유의해도 어느 쌍이 다른지는 사후검정이 따로 필요합니다. 던 검정을 쓰거나, 짝마다 맨-휘트니 검정을 돌린 뒤 다중비교 보정을 하는 방법이 있습니다. 이 계산기의 범위 밖입니다.보정 없이 짝마다 검정을 돌리면 안 됩니다. 집단이 3개면 짝이 3번이라 우연히 유의한 것이 섞여 나옵니다.
«중앙값 검정»이라고 부르는 것은 정확하지 않습니다. 크루스칼-왈리스는 중앙값이 아니라 분포 전체가 같은지를 봅니다. 집단들의 퍼짐이 비슷할 때에만 «중앙값이 다르다»로 읽을 수 있습니다. 한 집단만 유독 넓게 퍼져 있으면 중앙값이 같아도 H가 커질 수 있습니다.효과크기 ε²는 H를 최댓값 N−1로 나눈 값(Tomczak & Tomczak, 2014)입니다. 0에 가까우면 집단끼리 순위가 골고루 섞여 있고, 1에 가까우면 집단별로 완전히 갈립니다. p값이 표본 크기에 따라 움직이는 것과 달리 이 값은 차이의 크기 자체를 나타냅니다.

계산 방법

  1. 1집단마다 한 줄씩, 값을 공백이나 쉼표로 나눠 붙여 넣습니다.
  2. 2H 통계량과 자유도, p값이 바로 계산됩니다.
  3. 3집단별 순위표에서 평균 순위가 어떻게 갈리는지 확인합니다.
  4. 4동점이 있으면 보정 전후의 H를 함께 보여 주므로 차이를 확인할 수 있습니다.

자주 묻는 질문

세 집단 이상의 분포가 같은지를 정규성 가정 없이 볼 때 씁니다. 일원배치 분산분석(ANOVA)의 자리에 들어가되, 자료가 정규분포를 따르지 않거나 서열 자료일 때 쓸 수 있습니다. 값을 전부 한 줄로 세워 순위를 매기고, 집단마다 순위가 골고루 섞였는지를 봅니다.

H = 12/(N(N+1)) × Σ(Rᵢ²/nᵢ) − 3(N+1)입니다. Rᵢ는 i번째 집단의 순위 합, nᵢ는 그 집단의 크기, N은 전체 개수입니다. 집단들이 순위를 골고루 나눠 가지면 H가 작고, 한 집단이 위쪽 순위를 몰아 가지면 H가 커집니다. H는 자유도 (집단 수 − 1)의 카이제곱분포로 근사합니다.

보정하지 않으면 H가 실제보다 작게 나와 있는 차이를 놓칩니다. 동점에 평균 순위를 나눠 주면 순위의 분산이 줄어드는데, 기본 식은 분산이 줄지 않는다고 보고 세운 것이기 때문입니다. C = 1 − Σ(tᵢ³−tᵢ)/(N³−N)로 나눠 보정하며, 5점 척도 설문처럼 값의 종류가 적은 자료에서는 이 한 줄이 결론을 바꿉니다.

이 검정만으로는 알 수 없습니다. H가 말해 주는 것은 «어딘가 다르다»까지입니다. 어느 쌍이 다른지 보려면 던 검정 같은 사후검정을 하거나, 짝마다 맨-휘트니 검정을 돌린 뒤 다중비교 보정을 해야 합니다. 보정 없이 짝마다 검정을 돌리면 세 집단이면 세 번, 다섯 집단이면 열 번을 보게 되어 우연히 유의한 것이 섞여 나옵니다.

ANOVA는 평균을, 크루스칼-왈리스는 순위를 봅니다. ANOVA는 각 집단이 정규분포를 따르고 분산이 같다고 가정하지만 이 검정은 그러지 않습니다. 대신 자료가 실제로 정규분포를 따른다면 ANOVA 쪽이 차이를 더 잘 잡아냅니다. 이상치가 있거나 서열 자료라면 크루스칼-왈리스가 안전합니다.

정확히는 아닙니다. 크루스칼-왈리스는 분포 전체가 같은지를 봅니다. 집단들의 퍼짐이 비슷할 때에만 결과를 «중앙값이 다르다»로 읽을 수 있습니다. 한 집단만 유독 넓게 퍼져 있으면 중앙값이 같아도 H가 커질 수 있습니다.

계산은 되지만 맨-휘트니 검정을 쓰는 편이 낫습니다. 두 집단일 때 H 검정은 맨-휘트니의 정규근사와 정확히 같은 값을 주는데(H = z²), 맨-휘트니는 표본이 작을 때 정확분포를 쓸 수 있어 더 미덥습니다. 이 계산기는 세 집단 이상을 한 번에 보려고 만들었습니다.

전송되지 않습니다. 모든 계산은 브라우저 안에서 이루어지며 입력값은 이 기기에만 남습니다.

알아두면 좋은 점

  • H와 p값을 scipy.stats.kruskal과 소수 여덟 자리 이상까지 대조해 검증했습니다. 동점이 많은 자료, 집단 크기가 제각각인 자료, 네 집단 자료를 포함합니다.
  • p값은 카이제곱 근사입니다. 집단이 작거나(각 5개 미만) 집단 수가 적으면 근사가 헐거워지며, 그럴 때는 정확검정을 쓰는 것이 맞습니다.
  • 사후검정(던 검정 등)은 다루지 않습니다. H가 유의해도 어느 집단끼리 다른지는 알려 주지 않습니다.
  • 효과크기 ε²는 H/(N−1)이며 Tomczak & Tomczak(2014)의 정의를 따랐습니다. 다른 정의(η²)를 쓰는 자료도 있어 값이 다를 수 있습니다.
  • 입력한 값은 브라우저 안에서만 계산되며 서버로 전송되지 않습니다.

함께 보면 좋은 도구

마지막 검증: 2026년 8월 31일 · 결과는 참고용 추정치입니다.