도구스학업·수학

종 다양성 지수(샤논·심슨) 계산기

종별 개체 수에서 샤논 H′, 심슨 D, 균등도 J′, 힐 수를 한 번에 계산합니다. 로그 밑에 따라 샤논 값이 통째로 달라지므로 밑을 골라 확인할 수 있습니다.

한 줄에 한 종씩 「이름: 개수」 또는 「이름 개수」로 넣습니다. 이름을 빼고 숫자만 넣어도 됩니다.

밑이 다르면 같은 자료라도 값이 통째로 달라집니다. 다른 자료와 견줄 때는 반드시 밑을 맞춰 주세요.

샤논 다양도 H′ (자연로그 ln)

1.3005 nat

종 5개 · 개체 100개 · 균등도 J′ 0.808

유효 종 수 ¹D = exp(H′)3.671
종 수 ⁰D (관찰된 종 수)5
유효 종 수 ²D = 1/D (역심슨)3.224

힐 수는 「모든 종이 똑같이 흔하다면 몇 종이어야 이만큼 다양한가」를 뜻해 단위가 «종»입니다. 차수가 올라갈수록 희귀종의 무게가 줄어 값이 작아지고, 완전히 고른 군집에서만 셋이 같아집니다. H′ 자체는 두 배가 되어도 두 배 다양한 것이 아니지만 힐 수는 두 배면 두 배라, 자료를 견줄 때는 힐 수로 옮겨 보는 편이 낫습니다.

샤논 H′1.3005 nat
H′ 의 최대값 (log S)1.6094
피엘루 균등도 J′ = H′/log S0.808
버거-파커 우점도 (가장 흔한 종의 비율)42%
심슨 우점도 D = Σpᵢ²0.3102
길리-심슨 다양도 1 − D0.6898
역심슨 1/D3.2237
유한표본 보정 D0.30323
«심슨 지수»는 방향이 두 가지입니다. 원래 심슨이 낸 D = Σpᵢ²는 무작위로 두 개체를 뽑았을 때 같은 종일 확률이라 다양할수록 작아집니다. 직관과 어긋나서 1 − D나 1/D를 쓰는 일이 흔한데, 셋 다 그냥 «심슨 지수»라고 불립니다. 어느 쪽인지 밝히지 않으면 방향이 뒤집힌 값을 견주게 되므로 위 표에 셋을 각각 다른 이름으로 적어 두었습니다. 유한표본 보정 D는 같은 개체를 다시 뽑지 않는다고 보고 nᵢ(nᵢ−1)/(N(N−1))로 계산한 것으로, 표본이 작을수록 그냥 D보다 작게 나옵니다.

종별 몫

개체 수비율 pᵢ−pᵢ·log pᵢ
참나무4242%0.3644
소나무3131%0.3631
단풍나무1818%0.3087
자작나무77%0.1861
층층나무22%0.0782
100100%1.3005

흔한 종도 희귀한 종도 아닌 «중간»에 있는 종이 H′에 가장 많이 보탭니다. 비율이 1에 가까우면 log가 0에 가까워지고, 0에 가까우면 pᵢ 자체가 작아지기 때문입니다.

계산 근거H′ = −Σ pᵢ·ln pᵢ = 1.30047 natJ′ = H′ / log S = 1.3005 / 1.6094 = 0.808D = Σ pᵢ² = 0.3102 · · · ¹D = exp(H′_ln) = exp(1.3005) = 3.671힐 수는 로그 밑에 흔들리지 않게 자연로그 기준의 H′로 계산했습니다. 균등도 J′도 분자와 분모가 같은 밑이라 약분되어 밑에 무관합니다 — 밑이 다른 자료를 견줄 때 J′를 같이 보면 안전한 이유입니다.
채집 노력이 다른 두 자료를 지수만으로 견주면 안 됩니다. 더 많이 조사하면 희귀종이 더 잡혀 종 수가 늘고 H′도 함께 오릅니다. 즉 지수의 차이가 군집의 차이인지 조사량의 차이인지 구분되지 않습니다. 표본 크기를 맞추는 희박화(rarefaction)를 거치거나, 힐 수를 바탕으로 커버리지를 맞춰 견주는 것이 정석인 것으로 추정됩니다.
생태학에서 나온 지수지만 «몇 종류가 얼마나 고르게 섞여 있는가»를 묻는 자리에는 그대로 쓸 수 있습니다. 시장 점유율의 집중도, 글의 어휘 풍부도, 오류 로그의 종류 분포가 그런 예입니다. 다만 시장 집중도에는 관행적으로 허핀달 지수(HHI)를 쓰는데, 이는 심슨 D에 10,000을 곱한 것과 같은 값입니다.

계산 방법

  1. 1한 줄에 한 종씩 「이름: 개체 수」로 넣습니다. 숫자만 넣어도 됩니다.
  2. 2샤논 지수의 로그 밑을 고릅니다. 다른 자료와 견줄 때는 그쪽과 밑을 맞춰야 합니다.
  3. 3샤논 H′와 균등도 J′로 다양한 정도와 고른 정도를 나눠 봅니다.
  4. 4힐 수(유효 종 수)로 옮겨 보면 «종» 단위라 크기를 견주기 쉽습니다.
  5. 5심슨 지수는 D·1−D·1/D 중 어느 것을 쓸지 정하고 그 이름을 함께 적어 둡니다.

자주 묻는 질문

H′ = −Σ pᵢ·log pᵢ입니다. pᵢ는 i번째 종의 비율, 즉 그 종의 개체 수를 전체 개체 수로 나눈 값입니다. 예를 들어 세 종이 50:30:20이면 −(0.5·ln0.5 + 0.3·ln0.3 + 0.2·ln0.2) = 1.0297입니다. 종 수가 많을수록, 그리고 종별 비율이 고를수록 커지며, 한 종만 있으면 0입니다.

밑을 바꾸는 것이 상수를 곱하는 것과 같기 때문입니다. 같은 자료라도 자연로그로 2.079인 값이 log₂로는 3.000, log₁₀으로는 0.903이 됩니다. 그래서 밑을 밝히지 않은 샤논 지수는 다른 자료와 견줄 수 없습니다. 자연로그가 가장 흔하지만 정보이론 쪽에서는 log₂를 써서 단위를 비트로 읽는 일이 많으니, 논문 값을 옮길 때 밑부터 확인하셔야 합니다.

J′ = H′ / log S로, 지금의 다양도가 그 종 수에서 낼 수 있는 최대치의 몇 퍼센트인지를 보여줍니다. 0과 1 사이이고 모든 종이 똑같이 흔하면 1입니다. 샤논 H′만 보면 종 수가 많아서 큰 것인지 고르게 섞여서 큰 것인지 구분되지 않는데, J′가 그 둘을 갈라 줍니다. 분자와 분모가 같은 밑이라 약분되어 로그 밑에 무관하다는 점도 견줄 때 유리합니다.

어느 심슨 지수인지에 따라 방향이 반대입니다. 원래 심슨이 낸 D = Σpᵢ²는 무작위로 두 개체를 뽑았을 때 같은 종일 확률이라 다양할수록 작아지는 «우점도»입니다. 직관과 어긋나서 1 − D(길리-심슨)나 1/D(역심슨)를 쓰는 일이 흔하고, 셋 다 그냥 심슨 지수라고 불립니다. 값을 적을 때는 반드시 어느 쪽인지 이름을 함께 적어야 방향이 뒤집힌 비교를 피할 수 있습니다.

모든 종이 똑같이 흔한 군집이라면 몇 종이어야 이만큼 다양한가를 뜻하는 값으로, 단위가 «종»이라 읽기 쉽습니다. 차수 0이면 그냥 종 수, 1이면 exp(H′), 2이면 1/D가 되며 차수가 올라갈수록 희귀종의 무게가 줄어 값이 작아집니다. 샤논 H′는 두 배가 되어도 두 배 다양한 것이 아니지만 힐 수는 두 배면 두 배라, 자료를 견줄 때는 힐 수로 옮겨 보는 편이 나은 것으로 추정됩니다.

그대로는 견줄 수 없습니다. 더 많이 조사하면 희귀종이 더 잡혀 종 수가 늘고 샤논 지수도 함께 오르기 때문에, 지수의 차이가 군집의 차이인지 조사량의 차이인지 구분되지 않습니다. 표본 크기를 작은 쪽에 맞추는 희박화를 거치거나, 힐 수를 바탕으로 표본 커버리지를 맞춰 견주는 것이 정석입니다. 균등도 J′는 종 수로 나눈 값이라 상대적으로 표본 크기에 덜 흔들립니다.

몇 종류가 얼마나 고르게 섞여 있는지를 묻는 자리라면 그대로 쓸 수 있습니다. 시장 점유율의 집중도, 글의 어휘 풍부도, 오류 로그의 종류 분포가 그런 예입니다. 실제로 시장 집중도에 쓰는 허핀달 지수(HHI)는 점유율을 퍼센트로 넣은 Σ(100pᵢ)²이라 심슨 D에 10,000을 곱한 것과 같은 값입니다.

전송되지 않습니다. 계산은 모두 브라우저 안에서 이루어지고 넣은 값은 이 기기에만 남습니다.

알아두면 좋은 점

  • 샤논 지수는 로그 밑에 따라 값이 통째로 달라집니다. 다른 자료와 견줄 때는 밑을 반드시 맞추고 함께 적어 두세요.
  • 심슨 지수는 D·1−D·1/D 셋 다 같은 이름으로 불리며 방향이 서로 반대입니다. 어느 것인지 밝히지 않은 값은 비교에 쓸 수 없습니다.
  • 조사량이 다르면 지수를 그대로 견줄 수 없습니다. 더 많이 조사할수록 종 수와 샤논 지수가 함께 오릅니다.
  • 유한표본 보정 심슨 D는 같은 개체를 다시 뽑지 않는다고 보고 계산한 값이라 그냥 D보다 작게 나옵니다. 표본이 작을수록 차이가 큽니다.
  • 개체 수 대신 생물량이나 피도 같은 연속값을 넣어도 계산은 되지만, 그때는 «두 개체를 뽑는다»는 심슨 지수의 해석이 성립하지 않습니다.

함께 보면 좋은 도구

마지막 검증: 2026년 9월 1일 · 결과는 참고용 추정치입니다.