도구스개발

섀넌 엔트로피 계산기

텍스트나 확률 분포의 섀넌 엔트로피를 계산합니다. 기호별 정보량과 중복도, 이론적 압축 하한까지 함께 냅니다.

문자 하나하나의 빈도로 엔트로피를 구합니다.

엔트로피

4.426 비트

기호 29가지 · 최대 4.858비트 · 중복도 8.9%

기호 하나당 엔트로피4.426 비트
기호 가짓수29가지
균등분포일 때 최대 (log₂ n)4.858 비트
중복도8.9%
글자 수45자
전체 정보량199.2 비트
이론적 압축 하한24.9 바이트
원본 (UTF-8)113 바이트
원본 대비22%

기호별로 보면

기호빈도확률정보량기여
(공백)1022.2%2.170.482
36.7%3.910.26
24.4%4.490.2
24.4%4.490.2
24.4%4.490.2
24.4%4.490.2
24.4%4.490.2
.12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122
12.2%5.490.122

많이 나온 24가지만 보여 줍니다 (전체 29가지).

정보량은 −log₂(확률)입니다. 드문 기호일수록 정보량이 큽니다 — 잘 안 나오던 것이 나오면 그만큼 놀랍기 때문입니다.

균등분포가 최대입니다. 기호가 n가지일 때 엔트로피는 log₂ n을 넘지 못하고, 모두 똑같이 자주 나올 때 그 값이 됩니다. 한쪽으로 쏠릴수록 낮아지고, 그 낮아진 몫이 중복도입니다 — 압축할 여지가 그만큼 있다는 뜻입니다.
이건 문자를 따로따로 봤을 때의 하한입니다. 섀넌의 소스 부호화 정리는 기호 하나를 평균 H비트보다 적게 담는 무손실 부호가 없다고 말하지만, 그건 기호가 서로 독립일 때입니다. 실제 글은 앞뒤가 이어져 있어서(q 다음엔 거의 u가 옵니다) gzip 같은 압축기는 이 값보다 더 줄입니다. 여기 나오는 값보다 작게 압축돼도 이상한 일이 아닙니다.
한글은 처음부터 비쌉니다. UTF-8에서 한글 한 글자는 3바이트인데 엔트로피는 글자 수로 셉니다. 그래서 같은 엔트로피여도 한글 문서의 압축 여지가 영문보다 큽니다.
H = −Σ p log₂ p 입니다. 밑을 2로 두어 비트로 재고, 자연로그를 쓰면 내트(nat), 밑 10이면 하틀리(hartley)가 됩니다. 여기 계산은 전부 브라우저에서 이뤄지며 넣은 텍스트는 서버로 전송되지 않습니다.

사용 방법

  1. 1텍스트를 넣으면 문자 빈도로 엔트로피를 구합니다.
  2. 2확률을 직접 넣으려면 위에서 모드를 바꾸세요.
  3. 3기호별 표에서 어느 기호가 정보를 많이 담는지 볼 수 있습니다.

자주 묻는 질문

H = −Σ p log₂ p 로, 다음에 무엇이 올지 얼마나 모르는가를 비트로 잰 값입니다. 동전 던지기는 1비트, 주사위는 약 2.585비트이고, 늘 같은 것만 나오면 0입니다.

용도에 따라 다릅니다. 비밀번호나 난수는 클수록 예측하기 어려워 좋고, 압축하려는 데이터는 작을수록 줄일 여지가 많습니다. 같은 값이 반대로 읽히는 셈입니다.

기호가 n가지일 때 log₂ n입니다. 모든 기호가 똑같이 자주 나올 때 그 값이 되고, 한쪽으로 쏠릴수록 낮아집니다. 낮아진 몫을 중복도라 하며 압축 여지를 나타냅니다.

섀넌의 소스 부호화 정리에 따르면 기호 하나를 평균 H비트보다 적게 담는 무손실 부호는 없습니다. 그래서 길이 × H가 압축의 바닥입니다.

이 하한은 기호가 서로 독립일 때의 값이기 때문입니다. 실제 글은 앞뒤가 이어져 있어서(q 다음엔 거의 u가 옵니다) 압축기는 그 관계까지 이용해 더 줄입니다. 여기 값보다 작아져도 이상한 일이 아닙니다.

기호 하나가 담은 정보의 양으로 −log₂(확률)입니다. 드문 기호일수록 큽니다. 잘 안 나오던 것이 나오면 그만큼 놀랍고, 그 놀라움의 크기가 정보량입니다. 엔트로피는 이 값의 확률 가중평균입니다.

알아두면 좋은 점

  • 밑을 2로 두어 비트 단위로 잽니다. 자연로그를 쓰면 내트(nat), 밑 10이면 하틀리(hartley)가 됩니다.
  • 텍스트는 코드 포인트 단위로 셉니다. 이모지 하나가 한 글자입니다.
  • 이론적 압축 하한은 기호가 서로 독립이라고 볼 때의 값입니다. 실제 압축기는 문맥까지 이용해 더 줄입니다.
  • 계산은 전부 브라우저에서 이뤄지며 넣은 텍스트는 서버로 전송되지 않습니다.

함께 보면 좋은 도구

마지막 검증: 2026년 8월 30일 · 결과는 참고용 추정치입니다.