도구스개발

친칠라 스케일링 법칙 계산기

컴퓨트 예산·파라미터 수·토큰 수 중 하나를 넣으면 친칠라(Chinchilla) 논문의 컴퓨트 최적(compute-optimal) 조합을 계산합니다. 내 학습 계획이 최적 비(토큰/파라미터 20배)에 가까운지도 함께 확인합니다.

십억(B)

최적 파라미터 수

700억개

토큰 1.4조개 · 연산량 5.880 × 10^23 FLOPs

최적 파라미터 수700억
최적 토큰 수1.4조
학습 연산량(C=6ND)5.880 × 10^23 FLOPs
토큰 ÷ 파라미터20.0
친칠라(Chinchilla) 논문(Hoffmann et al. 2022, DeepMind)의 결론은 컴퓨트 예산이 늘면 파라미터 수와 토큰 수를 같은 비율로 늘려야 한다는 것과, 그 최적점에서 토큰/파라미터 비가 약 20이었다는 것입니다(친칠라 모델 자체가 70B 파라미터·1.4조 토큰 = 정확히 20배). 이 계산기는 C≈6ND, 토큰/파라미터=20이라는 단순화한 관계식으로 세 값 중 하나를 기준 삼아 나머지를 어림합니다.

내 계획과 비교

십억(B)
조(T)

토큰/파라미터 비 1.7 친칠라 최적(20배)보다 훨씬 낮습니다. 파라미터 수에 비해 학습 데이터가 부족해 모델 성능을 다 못 끌어냈을 가능성이 있습니다(과소학습).

사용 방법

  1. 1컴퓨트 예산·파라미터 수·토큰 수 중 무엇을 기준으로 삼을지 고릅니다.
  2. 2값을 입력하면 나머지 두 값이 컴퓨트 최적(compute-optimal) 조합으로 계산됩니다.
  3. 3아래 «내 계획과 비교»에 실제 계획 중인 파라미터·토큰 수를 넣어 최적 비(20배)와 얼마나 차이 나는지 확인합니다.

자주 묻는 질문

DeepMind가 2022년 발표한 논문(Hoffmann et al., "Training Compute-Optimal Large Language Models")의 결론으로, 같은 컴퓨트(연산량) 예산이라면 모델 크기(파라미터 수)와 학습 데이터 양(토큰 수)을 같은 비율로 늘려야 손실이 가장 낮아진다는 것입니다. 그전까지는 모델을 키우는 데만 치중해 GPT-3·Gopher 같은 대형 모델들이 데이터 대비 «과소학습» 상태였다는 것을 보여 화제가 됐습니다.

논문이 여러 컴퓨트 예산에서 손실을 가장 낮추는 조합을 실측한 결과, 최적점 부근에서 토큰 수가 파라미터 수의 약 20배였습니다. 논문이 실제로 학습한 친칠라 모델 자체가 파라미터 70B·토큰 1.4조(정확히 20배)입니다. 이 계산기는 이 실측 비율(20)과 학습 연산량 어림식(C≈6ND)만으로 나머지 값을 구하는 단순화 버전입니다.

참고용 경험칙으로만 쓰는 것이 안전합니다. 이 값은 «법칙»이 아니라 논문 한 편의 실험 데이터를 멱함수로 피팅해 얻은 권고치이고, Epoch AI 등 후속 재현 연구가 원 논문의 신뢰구간(피팅에 쓴 손실 곡선의 노이즈)에 이견을 제기했습니다. 데이터 품질·토크나이저·모델 구조·학습 기법에 따라 실제 최적 비는 달라질 수 있습니다.

아닙니다. 친칠라 최적은 «같은 학습 연산량으로 손실을 가장 낮추는» 조합일 뿐, 추론(서빙) 비용까지 고려한 최적은 아닙니다. 실무에서는 손실을 최적점보다 조금 손해 보더라도 모델을 더 작게 만들어(과대학습) 추론 비용을 줄이는 경우가 흔합니다(예: 라마 계열 모델들).

알아두면 좋은 점

  • 출처: Hoffmann et al. 2022, "Training Compute-Optimal Large Language Models"(DeepMind, 통칭 Chinchilla 논문). 이 환경의 네트워크 정책상 원문 PDF·공식 블로그를 직접 열람하지 못해 WebSearch로 여러 2차 자료(요약·해설)를 교차 확인했습니다(2026-09-11).
  • 학습 연산량은 C≈6ND(순전파 2N+역전파 4N) 어림입니다. 어텐션의 시퀀스 제곱 항 등은 빼며, 자세한 근거는 dev/transformer-flops 도구를 참고하세요.
  • 토큰/파라미터 최적 비 20은 논문의 실측 결과를 단순화한 경험칙입니다. 후속 재현 연구가 정확한 수치에 이견을 제기하고 있어, 실제 최적 비는 데이터 품질 등에 따라 달라질 수 있습니다.
  • 입력값은 서버로 전송되지 않고 브라우저 안에서만 계산됩니다.

함께 보면 좋은 도구

마지막 검증: 2026년 9월 11일 · 결과는 참고용 추정치입니다.