N-그램 생성기
텍스트를 글자 또는 단어 단위로 N개씩 겹치게 잘라 나열합니다. 검색 자동완성·오타 교정의 기초 원리입니다.
텍스트
조각 개수0개
한 칸씩만 밀며 겹치게 자릅니다 — "hello"를 2-그램으로 자르면 he, el, ll, lo 네 조각이 나옵니다 (안 겹쳤다면 he, ll, o 세 조각뿐이었을 것입니다).
사용 방법
- 1텍스트를 입력합니다.
- 2글자 단위인지 단어 단위인지, N값을 정합니다.
- 3만들어진 N-그램 조각들을 확인합니다.
자주 묻는 질문
텍스트를 N개씩 겹치게 잘라 나열한 조각들입니다. "hello"를 2-그램(바이그램)으로 자르면 he, el, ll, lo 네 조각이 나옵니다. 한 칸씩만 밀며 자르기 때문에 조각 개수는 (전체 길이 − N + 1)개입니다.
안 겹치게 자르면(he, ll, o처럼) 잘리는 위치에 따라 같은 부분 문자열도 다른 조각으로 나뉠 수 있습니다. 겹치게 자르면 시작 위치와 무관하게 모든 연속된 N글자 조합을 빠짐없이 잡아낼 수 있어, 두 텍스트가 부분적으로 얼마나 비슷한지 비교하기 좋습니다.
검색엔진 자동완성과 오타 교정(비슷한 글자 조각을 가진 단어를 찾음), 표절 검사(문장 조각의 겹침을 비교), 언어 모델(앞의 N-1개 단어로 다음 단어를 확률적으로 예측)에 널리 쓰입니다.
글자 단위(char n-gram)는 오타나 철자 유사도를 볼 때, 단어 단위(word n-gram)는 문장의 표현이나 어순 패턴을 볼 때 씁니다. "brown fox"처럼 자주 붙어 나오는 단어 쌍을 찾는 것은 단어 단위 2-그램의 전형적인 쓰임입니다.
알아두면 좋은 점
- N이 텍스트 길이(단어 단위는 단어 개수)보다 크면 조각이 하나도 안 나옵니다.
함께 보면 좋은 도구
TF-IDF 가중치문서 여러 개를 넣으면 낱말마다 tf와 idf를 내고 그 문서를 특징짓는 낱말을 뽑습니다.편집 거리 단계두 문자열의 편집 거리를 구하고 어떤 연산을 어느 순서로 하는지 DP 표와 함께 보여 줍니다.gitignore 판정.gitignore 규칙과 경로를 넣으면 그 파일이 무시되는지, 어느 줄이 마지막으로 이겼는지 알려줍니다.울프람 규칙규칙 번호 0~255를 8비트로 풀어 세 칸 이웃에 대응시키고 세대를 쌓아 무늬를 그립니다.2-SAT「둘 중 하나는 참」인 조건을 여럿 넣으면 참·거짓 배정이 가능한지 판정하고 배정을 하나 찾아 줍니다.
마지막 검증: 2026년 9월 2일 · 결과는 참고용 추정치입니다.