섀넌 엔트로피 계산기
텍스트나 확률 분포의 섀넌 엔트로피를 계산합니다. 기호별 정보량과 중복도, 이론적 압축 하한까지 함께 냅니다.
문자 하나하나의 빈도로 엔트로피를 구합니다.
엔트로피
4.426 비트
기호 29가지 · 최대 4.858비트 · 중복도 8.9%
기호별로 보면
| 기호 | 빈도 | 확률 | 정보량 | 기여 |
|---|---|---|---|---|
| (공백) | 10 | 22.2% | 2.17 | 0.482 |
| 이 | 3 | 6.7% | 3.91 | 0.26 |
| 는 | 2 | 4.4% | 4.49 | 0.2 |
| 다 | 2 | 4.4% | 4.49 | 0.2 |
| 로 | 2 | 4.4% | 4.49 | 0.2 |
| 에 | 2 | 4.4% | 4.49 | 0.2 |
| 트 | 2 | 4.4% | 4.49 | 0.2 |
| . | 1 | 2.2% | 5.49 | 0.122 |
| 가 | 1 | 2.2% | 5.49 | 0.122 |
| 값 | 1 | 2.2% | 5.49 | 0.122 |
| 나 | 1 | 2.2% | 5.49 | 0.122 |
| 론 | 1 | 2.2% | 5.49 | 0.122 |
| 르 | 1 | 2.2% | 5.49 | 0.122 |
| 를 | 1 | 2.2% | 5.49 | 0.122 |
| 마 | 1 | 2.2% | 5.49 | 0.122 |
| 모 | 1 | 2.2% | 5.49 | 0.122 |
| 무 | 1 | 2.2% | 5.49 | 0.122 |
| 보 | 1 | 2.2% | 5.49 | 0.122 |
| 비 | 1 | 2.2% | 5.49 | 0.122 |
| 서 | 1 | 2.2% | 5.49 | 0.122 |
| 얼 | 1 | 2.2% | 5.49 | 0.122 |
| 엇 | 1 | 2.2% | 5.49 | 0.122 |
| 엔 | 1 | 2.2% | 5.49 | 0.122 |
| 올 | 1 | 2.2% | 5.49 | 0.122 |
많이 나온 24가지만 보여 줍니다 (전체 29가지).
정보량은 −log₂(확률)입니다. 드문 기호일수록 정보량이 큽니다 — 잘 안 나오던 것이 나오면 그만큼 놀랍기 때문입니다.
사용 방법
- 1텍스트를 넣으면 문자 빈도로 엔트로피를 구합니다.
- 2확률을 직접 넣으려면 위에서 모드를 바꾸세요.
- 3기호별 표에서 어느 기호가 정보를 많이 담는지 볼 수 있습니다.
자주 묻는 질문
H = −Σ p log₂ p 로, 다음에 무엇이 올지 얼마나 모르는가를 비트로 잰 값입니다. 동전 던지기는 1비트, 주사위는 약 2.585비트이고, 늘 같은 것만 나오면 0입니다.
용도에 따라 다릅니다. 비밀번호나 난수는 클수록 예측하기 어려워 좋고, 압축하려는 데이터는 작을수록 줄일 여지가 많습니다. 같은 값이 반대로 읽히는 셈입니다.
기호가 n가지일 때 log₂ n입니다. 모든 기호가 똑같이 자주 나올 때 그 값이 되고, 한쪽으로 쏠릴수록 낮아집니다. 낮아진 몫을 중복도라 하며 압축 여지를 나타냅니다.
섀넌의 소스 부호화 정리에 따르면 기호 하나를 평균 H비트보다 적게 담는 무손실 부호는 없습니다. 그래서 길이 × H가 압축의 바닥입니다.
이 하한은 기호가 서로 독립일 때의 값이기 때문입니다. 실제 글은 앞뒤가 이어져 있어서(q 다음엔 거의 u가 옵니다) 압축기는 그 관계까지 이용해 더 줄입니다. 여기 값보다 작아져도 이상한 일이 아닙니다.
기호 하나가 담은 정보의 양으로 −log₂(확률)입니다. 드문 기호일수록 큽니다. 잘 안 나오던 것이 나오면 그만큼 놀랍고, 그 놀라움의 크기가 정보량입니다. 엔트로피는 이 값의 확률 가중평균입니다.
알아두면 좋은 점
- 밑을 2로 두어 비트 단위로 잽니다. 자연로그를 쓰면 내트(nat), 밑 10이면 하틀리(hartley)가 됩니다.
- 텍스트는 코드 포인트 단위로 셉니다. 이모지 하나가 한 글자입니다.
- 이론적 압축 하한은 기호가 서로 독립이라고 볼 때의 값입니다. 실제 압축기는 문맥까지 이용해 더 줄입니다.
- 계산은 전부 브라우저에서 이뤄지며 넣은 텍스트는 서버로 전송되지 않습니다.
함께 보면 좋은 도구
마지막 검증: 2026년 8월 30일 · 결과는 참고용 추정치입니다.