학습률 스케줄 계산기
워밍업과 코사인·선형·스텝·지수 감쇠 스케줄의 특정 스텝 학습률과 곡선을 계산합니다. 누적 학습률까지 함께 내어 스케줄끼리 견줄 수 있고, 워밍업을 전체 스텝에 포함하는지도 고를 수 있습니다.
워밍업이 끝나는 지점의 값이자 감쇠가 시작하는 값입니다
마지막 스텝에 닿는 값입니다. 0으로 두면 끝에서 0이 됩니다
0에서 lr_max까지 선형으로 올리는 구간입니다
0이면 재시작하지 않습니다. 값을 넣으면 그 주기마다 lr_max로 되돌아갑니다
3,000스텝의 학습률
8.8300e-4
감쇠 구간입니다 · 전체 10,000스텝 중 30% 지점
곡선
| 스텝 | 학습률 | lr_max 대비 |
|---|---|---|
| 0 | 1.0000e-6 | 0.1% |
| 833 | 8.3400e-4 | 83.4% |
| 1,667 | 9.8651e-4 | 98.7% |
| 2,500 | 9.3300e-4 | 93.3% |
| 3,333 | 8.4313e-4 | 84.3% |
| 4,166 | 7.2445e-4 | 72.4% |
| 5,000 | 5.8675e-4 | 58.7% |
| 5,833 | 4.4192e-4 | 44.2% |
| 6,666 | 3.0197e-4 | 30.2% |
| 7,499 | 1.7864e-4 | 17.9% |
| 8,333 | 8.2210e-5 | 8.2% |
| 9,166 | 2.0993e-5 | 2.1% |
| 9,999 | 0 | 0% |
사용 방법
- 1감쇠 방식을 고릅니다. 코사인·선형·스텝·지수·고정 중에서 고르면 됩니다.
- 2최대·최소 학습률과 전체 스텝 수, 워밍업 스텝 수를 넣습니다.
- 3워밍업을 전체 스텝에 포함할지 고릅니다. 여기서 곡선이 통째로 갈립니다.
- 4값을 볼 스텝을 넣어 그 시점의 학습률과 진행률을 확인합니다.
- 5누적 학습률로 다른 설정과 견줍니다. 같은 총량을 어떻게 나눠 쓰는지가 보입니다.
자주 묻는 질문
lr = lr_min + ½(lr_max − lr_min)(1 + cos(πp))이며 p는 감쇠 구간의 진행도입니다. p가 0이면 lr_max, 1이면 lr_min, 0.5면 정확히 두 값의 평균이 됩니다. 이 계산기는 감쇠 구간의 마지막 스텝에서 p가 정확히 1이 되도록 p = i/(D−1)로 잡아, 마지막 스텝의 학습률이 lr_min에 정확히 닿습니다.
어느 쪽이든 되지만 반드시 밝혀야 합니다. 전체 10,000스텝에 워밍업 1,000이라 할 때 포함하면 감쇠가 9,000스텝이고 총 10,000스텝을 돌지만, 포함하지 않으면 감쇠가 10,000스텝이라 총 11,000스텝을 돕니다. 같은 설정이라고 적어 두고 서로 다른 곡선을 그리는 일이 흔해서 이 계산기는 입력으로 노출하고 두 경우의 값을 함께 보여 줍니다.
총량은 정확히 같습니다. 같은 lr_max·lr_min·스텝 수라면 누적 학습률 Σlr이 둘 다 스텝 수 × (lr_max+lr_min)/2로 떨어집니다. 코사인의 코사인 항이 대칭이라 합이 0이 되고, 선형은 등차수열이라 평균이 한가운데이기 때문입니다. 차이는 «언제»에 있어서, 코사인은 앞쪽에 오래 머무르다 가운데에서 가파르게 떨어지고 끝에서 다시 완만해집니다.
스케줄끼리 견주는 눈금이기 때문입니다. 「학습률을 절반으로 줄이고 스텝을 두 배로」 같은 이야기를 할 때 실제로 같은 양을 쓰는지 확인할 수 있고, 스텝 감쇠처럼 일찍 크게 떨어뜨리는 방식이 고정 학습률의 몇 %만 쓰는지도 바로 보입니다. 다만 이것은 어디까지나 눈금이지 학습 결과를 예측하는 값은 아닙니다.
구현마다 다릅니다. 이 계산기는 스텝 t에서 lr_max × (t+1)/워밍업으로 계산해 첫 스텝이 0이 아니고 마지막 워밍업 스텝에서 정확히 lr_max에 닿습니다. t/워밍업을 쓰는 구현도 흔한데 그 경우 첫 스텝의 학습률이 0이 되어 한 스텝을 버리는 셈이 됩니다. 스텝 수가 많으면 차이가 미미하지만 워밍업이 짧으면 눈에 띕니다.
총량은 달라지지 않습니다. 코사인 한 주기의 평균이 주기 길이와 무관하게 (lr_max+lr_min)/2이므로, 주기가 전체 구간을 딱 나누어떨어지면 누적 학습률이 재시작 없을 때와 같습니다. 재시작의 목적은 총량을 늘리는 것이 아니라 학습률을 주기적으로 다시 올려 국소해에서 빠져나오게 하는 데 있습니다.
알려 주지 않습니다. 어떤 lr_max가 맞는지는 모델 크기·배치 크기·옵티마이저·데이터에 따라 달라져 식으로 정할 수 없습니다. 이 계산기는 정해진 설정의 곡선을 그리고 설정을 바꿨을 때의 차이를 보여 주는 도구입니다.
전송되지 않습니다. 계산은 모두 브라우저 안에서 이루어지고 넣은 값은 이 기기에만 남습니다.
알아두면 좋은 점
- 워밍업을 전체 스텝에 포함하는지가 곡선을 통째로 바꿉니다. 설정을 옮겨 적을 때 이 규약도 함께 적어야 재현됩니다.
- 워밍업 값은 lr_max × (t+1)/워밍업 규약입니다. t/워밍업을 쓰는 구현은 첫 스텝이 0이 됩니다.
- 감쇠 진행도는 마지막 스텝에서 정확히 1이 되도록 잡아, 마지막 학습률이 lr_min에 정확히 닿습니다.
- 코사인·선형의 누적 학습률은 정확히 같습니다. 차이는 총량이 아니라 시점에 있습니다.
- 최적값을 추천하지 않습니다. 곡선과 누적 학습량을 견주는 도구입니다.
함께 보면 좋은 도구
마지막 검증: 2026년 9월 2일 · 결과는 참고용 추정치입니다.