UCB1 밴딧 알고리즘 계산기
각 팔(선택지)의 평균 보상과 시도 횟수를 넣으면 UCB1 점수(평균 + √(2ln N / nᵢ))를 계산해 다음에 당길 팔을 정합니다. 탐험과 활용을 자동으로 저울질하는 다중 슬롯머신(multi-armed bandit) 문제의 대표 해법입니다.
팔 A
팔 B
팔 C
다음에 당길 팔
팔 B
전체 시도 N = 35회
사용 방법
- 1팔(선택지)마다 이름·지금까지 당긴 횟수·평균 보상을 입력합니다.
- 2각 팔의 UCB1 점수(평균 보상 + 탐험 보너스)를 확인합니다.
- 3점수가 가장 높은, 다음에 당길 팔을 확인합니다.
- 4한 번도 안 당긴 팔이 있으면 그 팔이 항상 최우선으로 추천되는 것을 확인합니다.
자주 묻는 질문
슬롯머신이 여러 대(팔) 있고 각각 보상 확률이 다른데 그 확률을 모를 때, 제한된 시도 횟수 안에서 최대한 많은 보상을 얻으려면 어느 순서로 당겨야 하는가를 다루는 문제입니다. A/B 테스트에서 여러 시안 중 어느 것을 더 많이 노출할지 정하는 문제와 구조가 같습니다.
평균 보상(활용 항)에 탐험 보너스 √(2ln N/nᵢ)를 더합니다. 이 보너스는 그 팔을 적게 당길수록(nᵢ가 작을수록) 커져서, 아직 확신이 부족한 팔을 우대합니다. 반대로 전체 시도(N)가 늘어날수록 로그 함수라 아주 천천히 커져, 시간이 지날수록 평균 보상이 좋은 팔로 자연스럽게 수렴합니다.
공식의 분모(nᵢ)가 0이 되어 점수가 정의되지 않습니다. UCB1의 표준 절차는 모든 팔을 먼저 한 번씩 당겨 보는 것이라, 이 계산기도 안 당겨본 팔이 있으면 그 팔을 점수와 무관하게 최우선으로 추천합니다.
엡실론-그리디는 일정 확률(엡실론)로 무작위 탐험을 섞는 방식이라 탐험 정도가 고정됩니다. UCB1은 각 팔의 «불확실성»을 수식으로 직접 계산해 탐험량을 자동으로 조절한다는 점이 다릅니다 — 확신이 쌓인 팔은 저절로 덜 탐험하게 됩니다.
전송되지 않습니다. 모든 계산은 브라우저 안에서 이뤄지고 입력값은 이 기기에만 남습니다.
알아두면 좋은 점
- 평균 보상은 0~1 사이의 확률(클릭률 등)로 주는 경우가 많지만, 이 계산기는 범위를 제한하지 않습니다.
- 팔이 3개 이상이어도 계산할 수 있습니다.
- 점수가 동점이면 먼저 입력한 팔을 추천합니다.
- 입력한 값은 브라우저 안에서만 계산되며 서버로 전송되지 않습니다.
함께 보면 좋은 도구
마지막 검증: 2026년 9월 3일 · 결과는 참고용 추정치입니다.