도구스학업·수학

급내상관계수(ICC) 계산기

여러 평가자가 같은 대상을 매긴 점수표에서 급내상관계수와 신뢰구간을 계산합니다. ICC(1,1)·ICC(2,1)·ICC(3,1)과 각각의 평균 측정치까지 여섯 형태를 함께 내어 어느 것을 보고해야 하는지 알려 줍니다.

줄마다 한 대상, 줄 안에서는 평가자 순서대로 점수를 적습니다. 공백·쉼표·탭으로 구분합니다

ICC(2,1) — 이원배치 변량 · 절대일치 · 한 사람의 점수

0.29

95% 신뢰구간 0.019 ~ 0.761 · 흔히 쓰는 구간 기준으로 «낮음»입니다

결과를 적을 때는 어느 형태인지 함께 적어야 합니다. 지금 자료만 해도 같은 점수표에서 ICC(1,1) 0.166 · ICC(2,1) 0.29 · ICC(3,1) 0.715 로 갈립니다. 「ICC = 0.29」라고만 적으면 읽는 쪽이 어느 것인지 알 수 없습니다. 「ICC(2,1) = 0.29 (95% CI 0.0190.761)」처럼 적는 것이 보고 관행입니다.

여섯 형태 전부

형태ICC95% 신뢰구간해석
ICC(1,1)0.166-0.133 ~ 0.723낮음
ICC(2,1)0.290.019 ~ 0.761낮음
ICC(3,1)0.7150.342 ~ 0.946보통
ICC(1,4)0.443-0.884 ~ 0.912낮음
ICC(2,4)0.620.071 ~ 0.927보통
ICC(3,4)0.9090.676 ~ 0.986매우 좋음

평균 측정치는 단일 측정치에 스피어만–브라운 kρ/(1+(k−1)ρ)을 씌운 값입니다. 여러 명의 평균을 최종 점수로 쓸 때만 이 줄을 보셔야 합니다.

대상 수 n · 평가자 수 k6 · 4
MSR 대상 간 평균제곱11.242
MSC 평가자 간 평균제곱32.486
MSE 잔차 평균제곱1.019
MSW 대상 내 평균제곱6.264
F(5, 15) · p11.027 · <0.001
σ² 대상 = (MSR − MSE)/k2.556
σ² 평가자 = (MSC − MSE)/n5.244
σ² 오차 = MSE1.019
평가자 평균 차이 검정 F · p31.866 · <0.001
ICC는 분산의 몫입니다. ICC(2,1)은 σ²대상 ÷ (σ²대상 + σ²평가자 + σ²오차)이고, ICC(3,1)은 분모에서 σ²평가자를 뺀 값입니다. 지금 자료의 평가자 분산은 5.244이고 평가자 평균이 다른지 보는 검정의 p값은 0.001 미만입니다 — 평가자마다 후하고 박한 정도가 달라, 절대일치를 보는 ICC(2,1)이 일관성만 보는 ICC(3,1)보다 낮게 나옵니다.
대상들이 서로 비슷하면 ICC가 낮게 나옵니다. ICC는 전체 분산 중 대상 사이 분산의 몫이라, 평가자들이 잘 맞더라도 대상들이 고만고만하면 나눌 것이 없어 값이 떨어집니다. 그래서 같은 측정도구라도 표본을 좁게 잡으면 ICC가 내려갑니다 — 다른 연구의 ICC와 견줄 때는 대상의 폭이 비슷한지부터 보셔야 합니다.
어느 형태를 골라야 하는지일원배치 ICC(1,·) — 대상마다 평가자가 다른 사람일 때. 누가 쟀는지 자료에 남지 않는 경우입니다.변량·절대일치 ICC(2,·) — 같은 평가자들이 모두를 평가했고, 이 결과를 다른 평가자에게로 일반화하고 싶을 때. 점수의 «크기»까지 맞아야 하면 이것입니다.혼합·일관성 ICC(3,·) — 이 평가자들이 관심의 전부이고, 한 사람이 늘 2점씩 후해도 순위만 같으면 된다고 볼 때.측정기기의 검사–재검사 신뢰도처럼 절대적인 값이 중요한 자리에서는 ICC(2,1)을 쓰는 것이 보통입니다.
점수가 «순서 없는 범주»(예: 진단명)라면 ICC 대신 카파 계수를, 한 검사 안의 문항들이 같은 것을 재는지 보려면 크론바흐 알파를 보셔야 합니다. ICC는 연속형 점수를 여러 번 잰 자료의 신뢰도입니다. 결측이 있는 대상은 이 계산기가 다루지 못하므로 그 줄을 빼고 넣어 주세요 — 빼고 계산하면 표본이 줄어 신뢰구간이 넓어진다는 점은 감안하셔야 합니다.

계산 방법

  1. 1점수표를 붙여 넣습니다. 줄마다 한 대상, 줄 안에서는 평가자 순서대로 점수를 적습니다.
  2. 2모형을 고릅니다. 대상마다 평가자가 다르면 일원배치, 같은 평가자들이 모두를 평가했으면 이원배치입니다.
  3. 3이원배치라면 점수의 크기까지 맞아야 하는지(절대일치)와 순위만 맞으면 되는지(일관성)를 고릅니다.
  4. 4최종 점수로 한 사람의 점수를 쓸지 여러 명의 평균을 쓸지 고릅니다.
  5. 5결과를 적을 때는 「ICC(2,1) = 0.290 (95% CI 0.019–0.761)」처럼 형태와 신뢰구간을 함께 적습니다.

자주 묻는 질문

평가자를 어떻게 뽑았는지와 무엇을 최종 점수로 쓸지가 기준입니다. 대상마다 평가자가 다른 사람이면 ICC(1,·), 같은 평가자들이 모두를 평가했고 결과를 다른 평가자에게 일반화하고 싶으면 ICC(2,·), 이 평가자들이 관심의 전부면 ICC(3,·)입니다. 여기에 최종 점수로 한 사람의 점수를 쓰면 (·,1), k명의 평균을 쓰면 (·,k)가 붙습니다. 측정기기의 검사–재검사 신뢰도처럼 절대적인 값이 중요한 자리에서는 ICC(2,1)을 쓰는 것이 보통입니다.

한 평가자가 늘 2점씩 후하게 줄 때 일관성은 그것을 문제 삼지 않고 절대일치는 벌점으로 봅니다. 그래서 평가자마다 후하고 박한 정도가 다르면 ICC(2,1)이 ICC(3,1)보다 낮게 나오며, 이 차이가 두 배를 넘기도 합니다. 순위만 같으면 되는 경우(예: 지원자를 줄 세우기)에는 일관성으로 충분하지만, 점수 자체를 값으로 쓰는 경우(예: 혈압계 두 대의 측정값)에는 절대일치를 보셔야 합니다.

흔히 인용되는 Koo & Li(2016)의 구간은 0.5 미만 낮음, 0.5~0.75 보통, 0.75~0.9 좋음, 0.9 이상 매우 좋음입니다. 다만 이것은 관행적인 눈금일 뿐 기준이 아니며, 임상 측정처럼 개인의 값을 판단에 쓰는 자리에서는 0.9 이상을 요구하기도 합니다. 점 추정치보다 신뢰구간의 아래끝을 보고 판단하시는 편이 안전합니다 — 표본이 작으면 구간이 아주 넓게 나옵니다.

나올 수 있습니다. 대상 사이의 분산보다 대상 안의 분산이 더 크면 분자가 음수가 되기 때문이며, 「대상을 구분해 주는 정보가 사실상 없다」는 뜻으로 읽습니다. 원래의 분산성분 정의로는 0보다 작을 수 없으므로 보고할 때 0으로 잘라 적는 관행도 있지만, 계산 그대로 적고 신뢰구간을 함께 보이는 편이 정직합니다.

피어슨 r은 두 평가자의 점수가 나란히 움직이기만 하면 1이 되지만 ICC는 값이 실제로 같은지까지 봅니다. 평가자 B가 늘 A보다 10점씩 높게 주면 r은 1이지만 절대일치 ICC는 크게 떨어집니다. 또 r은 평가자가 셋 이상이면 짝마다 따로 구해야 하는 데 비해 ICC는 한 번에 냅니다.

대상들의 폭이 좁으면 ICC가 낮아집니다. ICC는 전체 분산 중 대상 사이 분산이 차지하는 몫이라, 평가자들이 아무리 잘 맞아도 대상들이 고만고만하면 나눌 것이 없어 값이 떨어집니다. 그래서 표본을 좁게 잡은 연구는 같은 측정도구를 써도 ICC가 낮게 나옵니다. 다른 연구와 견줄 때는 대상의 분포가 비슷한지부터 확인하셔야 하며, 이럴 때는 측정오차 자체를 보는 측정표준오차(SEM)를 함께 적기도 합니다.

재는 대상이 다릅니다. 카파는 진단명처럼 순서 없는 범주에 대한 일치도, 크론바흐 알파는 한 검사 안의 문항들이 같은 것을 재는지 보는 내적 일관성, ICC는 연속형 점수를 여러 번 잰 자료의 신뢰도입니다. 참고로 ICC(3,k)는 크론바흐 알파와 수식이 같아 값이 일치합니다 — 다만 «문항»을 평가자로 볼 때의 이야기입니다.

전송되지 않습니다. 계산은 모두 브라우저 안에서 이루어지고 넣은 값은 이 기기에만 남습니다.

알아두면 좋은 점

  • 형태를 밝히지 않은 ICC는 읽을 수 없습니다. 같은 점수표에서 ICC(1,1)·ICC(2,1)·ICC(3,1)이 0.17·0.29·0.71로 갈리기도 합니다.
  • 신뢰구간은 Shrout & Fleiss(1979)의 F 분포 기반 식입니다. ICC(2,1)만 Satterthwaite 근사 자유도를 씁니다.
  • 평균 측정치 ICC(·,k)는 단일 측정치에 스피어만–브라운을 씌운 값과 정확히 같습니다. 여러 명의 평균을 최종 점수로 쓸 때만 보셔야 합니다.
  • 평가자 분산 추정치가 음수로 나오면 ICC(2,1)이 ICC(3,1)보다 높아질 수 있습니다. 표본에서 우연히 평가자 간 변동이 잔차보다 작게 나온 것이지 절대일치가 더 좋다는 뜻은 아닙니다.
  • 결측이 있는 대상은 다루지 못합니다. 그 줄을 빼고 넣으시되 표본이 줄어 신뢰구간이 넓어진다는 점은 감안하셔야 합니다.
  • Shrout & Fleiss(1979)의 6대상×4평가자 예제로 여섯 값과 신뢰구간을 모두 대조해 두었습니다.

함께 보면 좋은 도구

마지막 검증: 2026년 9월 2일 · 결과는 참고용 추정치입니다.