GPT 토큰 계산기
텍스트를 붙여넣으면 GPT 모델이 실제로 쓰는 BPE 어휘 그대로 토큰 수를 계산합니다. cl100k_base·o200k_base 두 인코딩을 지원합니다.
입력한 텍스트는 서버로 전송되지 않습니다.
토큰 수
17개
o200k_base — GPT-4o·GPT-4.1·GPT-5·o-시리즈
사용 방법
- 1텍스트를 입력창에 붙여넣습니다.
- 2모델에 맞는 인코딩(cl100k_base 또는 o200k_base)을 고릅니다.
- 3토큰 수를 확인합니다. API 요금·컨텍스트 길이 계산에 활용하세요.
자주 묻는 질문
GPT-4o·GPT-4.1·GPT-5·o1/o3/o4 같은 최신 모델은 o200k_base를, GPT-3.5-turbo·GPT-4·GPT-4-turbo·text-embedding-ada-002 같은 이전 모델은 cl100k_base를 씁니다.
GPT 모델은 글자 하나하나가 아니라, 자주 등장하는 글자 묶음을 "토큰"이라는 단위로 잘라서 처리합니다. 영어는 보통 한 단어가 1개 안팎의 토큰이지만, 한글은 자모·음절 조합 방식 때문에 한 글자가 여러 토큰으로 쪼개지는 경우가 많습니다.
일반적인 텍스트라면 그렇습니다. OpenAI가 공개한 tiktoken의 실제 어휘표와 병합 알고리즘을 그대로 옮겼기 때문입니다. 다만 "<|endoftext|>" 같은 특수 토큰 문자열이나 채팅 형식(역할 구분자 등)의 추가 오버헤드는 계산하지 않으므로, 그런 특수한 입력에서는 실제 API 결과와 다를 수 있습니다.
한글·이모지·드문 기호는 흔한 영어 단어보다 훨씬 잘게 쪼개지기 때문입니다. 같은 뜻의 문장이라도 한글이 영어보다 토큰을 더 많이 쓰는 경우가 흔합니다.
전송되지 않습니다. 어휘표와 계산 로직을 모두 브라우저로 내려받아 그 안에서 계산하고, 입력값은 이 기기에만 남습니다.
알아두면 좋은 점
- 어휘 데이터 출처: niieani/gpt-tokenizer(MIT License) 저장소가 공개한 OpenAI tiktoken 어휘 파일(cl100k_base.tiktoken·o200k_base.tiktoken)을 2026-09-05에 그대로 옮겼습니다. 병합 알고리즘은 OpenAI가 tiktoken 저장소에 공개한 교육용 참고 구현을 그대로 포팅했습니다.
- 토큰 분리 정규식은 OpenAI 원문(PCRE 문법)을 JavaScript에서 쓸 수 있게 이미 변환해 둔 niieani/gpt-tokenizer의 값을 가져왔습니다.
- 특수 토큰과 채팅 형식 오버헤드는 계산하지 않습니다. 순수 텍스트의 토큰 수만 셉니다.
함께 보면 좋은 도구
마지막 검증: 2026년 9월 5일 · 결과는 참고용 추정치입니다.