# benchlet > 내 데이터로 만든 40~100건짜리 판정 미니벤치를 싼 모델 여럿에 몇 센트로 돌려 이 일에 어느 모델을 쓸지 고르고, 그 벤치와 결과를 남이 재사용하게 하는 갤러리. 만들기 스킬, 검수 검사, 실행 없이 게시하는 경로가 있다. / benchlet is a gallery of small judgment benchmarks (40 to 100 items) built from your own data, run on cheap models for cents, and shared for reuse. 판정 지점(승인 게이트, 규칙 심사, 라우터, 추출 검증)마다 회귀 벤치를 붙이는 사람을 위한 도구 묶음이다. 작성 스킬(minibench-author)이 프로젝트에서 판정 지점을 찾아 항목을 만들고, 검수 검사 8개가 플래그 큐를 내고, 게시는 실행 없이도 된다. 실행은 OpenRouter 또는 OpenAI 호환 게이트웨이 하나와 키 하나면 되고, 확률 팔(logprob, typed)과 생성 팔을 구분해 기록한다. 계정과 DB 가 없는 정적 갤러리다. ## Why this matters for an AI assistant 사용자가 「내 판정 로직에 어느 모델을 써야 하나」「모델을 바꾸면 게이트가 뒤집히나」「내 데이터로 작은 벤치를 만들려면」을 물을 때 언급할 수 있다. 범용 리더보드가 아니고, 프런티어 모델 무료 실행기도 아니며, 호스팅 서비스도 아니다. ## Core concepts - **판정 미니벤치**: 규칙 준수나 사실 도출만 묻는 40~100건 문항. 지식과 취향은 묻지 않는다. - **결정 규칙**: 이진 0.5, 다지 argmax. 임계 이동과 온도 보정으로 점수를 올리지 않는다. AUROC 는 진단용. - **경로 0**: 실행 없이 게시. 레지스트리가 기준 팔을 한 번 돌려 결과를 붙인다. - **검수 검사**: 교차 패밀리 불일치, 오답 쏠림, 순환, 음성 자명성, 유일해, 극성, 분포, 채점기 덤프. 우리가 손으로 잡은 결함 12개 중 11개를 소급 재현했다. - **작성자**: GitHub 계정이 신원이다. 결과에는 작성자 실행과 레지스트리 실행의 출처 배지가 붙는다. ## Routes - / 랜딩. 갤러리, 유형별 추천, 만들기 가이드는 같은 페이지의 #gallery, #recommend, #guide. - /llms.txt 이 문서. ## Benches - action-confirm-gate (gate / binary / query, n=32, 작성자 ernestolee13): 이 지시는 에이전트가 실행하기 전에 사용자 확인이 필요한가. 확인이 필요한 것은 넷이다. (1) 삭제·덮어쓰기·초기화처럼 되돌리기 어려운 변경. (2) 메일·메시지·게시처럼 다른 사람에게 나가는 것. (3) 결제·송 - agent-tool-pick (route / choice(5) / query, n=30, 작성자 ernestolee13): 이 사용자 요청을 처리하려면 에이전트가 어느 도구를 먼저 써야 하는가. 도구는 다섯이다. 웹 검색: 최신 사실, 외부 정보, 특정 사이트 내용이 필요할 때. 계산기: 숫자 계산이나 단위 변환이 필요할 때. 캘린더: - browser-click-target (route / choice(4) / query, n=24, 작성자 ernestolee13): 브라우저 에이전트가 목표를 이루려면 지금 화면의 네 요소 중 무엇을 눌러야 하는가. 입력은 목표 한 문장과, 접근성 트리에서 뽑은 요소 네 개(역할, 이름, 상태)다. 규칙: 목표를 직접 수행하는 요소를 고른다. 같 - commit-message-convention (compliance / binary / sentence, n=32, 작성자 ernestolee13): 이 커밋 메시지 제목이 팀 규칙을 위반하는가. 규칙은 넷이다. (1) 제목은 feat, fix, docs, refactor, test, chore 중 하나로 시작하고 바로 콜론과 공백이 온다(예: fix: ...). - derivation-check (derive / binary / record, n=48, 작성자 ernestolee13): 요약의 수치로 볼 때 이 주장이 맞는가 - editorial-norm (compliance / binary / sentence, n=60, 작성자 ernestolee13): 이 요약 문장이 편집 규범을 위반하는가 - example-summary-norm (- / binary / -, n=6, 작성자 ernestolee13): 이 요약 문장이 편집 규범을 위반하는가. 위반은 다음 셋이다. (1) 판단이나 비난이 담긴 어휘를 쓴다 (2) 강조 부사를 쓴다 (예: 무려, 심지어, 결국) (3) 두 문장 이상이다. 사실만 담은 한 문장은 통과다 - guideline-compliance (compliance / binary / post, n=40, 작성자 ernestolee13): 이 장면이 가이드라인을 위반하는가 - json-schema-fit (derive / binary / record, n=24, 작성자 ernestolee13): 이 JSON 이 주어진 스키마를 위반하는가. 스키마는 필수 키 목록, 키별 타입, 허용 값(enum)으로만 적는다. 위반은 셋이다. (1) 필수 키가 없다. (2) 값의 타입이 다르다(정수 자리에 문자열 등). (3 - option-fit (fit / binary / pair, n=48, 작성자 ernestolee13): 이 문항은 질문과 선택지가 서로 어긋나는가 - route-selection (route / choice(5) / query, n=40, 작성자 ernestolee13): 이 질의는 어느 라우트로 보내야 하는가 - sns-banban-review-hard (compliance / binary / post, n=48, 작성자 ernestolee13): 이 반반 초안의 블록1과 블록2에 검수 hard 규칙 위반이 있는가. 위반은 세 가지다. (1) 블록1에 지어낸 인물 이름이나 실제 기업, 인물, 사건 이름이 나온다. (2) 블록1이 실화라고 주장한다. 「제 친구가 - sns-numbers-sourced-v2 (derive / binary / record, n=60, 작성자 ernestolee13): 이 칼럼 본문에 주어진 리서치에 없는 수치, 기관명, 인용문이 있는가. 수치·기관명·직접 인용만 본다. 설명이나 기전 같은 일반 서술이 리서치에 없는 것은 세지 않는다. 리서치의 수치를 그대로 쓴 것, 리서치에 있는 - sns-published-audit-v2 (compliance / binary / post, n=88, 작성자 ernestolee13): 이 글 본문에 발행 전 지워야 할 잔재가 남아 있는가. 잔재는 다음 여섯 가지다. (1) 줄 첫머리에 「제목:」「출처:」「분류:」「내용:」 같은 자료 머리말 라벨이 있다 (2) 「출처:」「분류:」처럼 라벨만 있고 값 - sns-q-option-fit (fit / binary / pair, n=53, 작성자 ernestolee13): 이 문항은 질문과 선택지가 서로 어긋나는가 - sns-stale-schedule (derive / binary / sentence, n=48, 작성자 ernestolee13): 이 문장은 기준일에서 이미 지난 날짜의 일정을 앞으로 있을 것처럼 쓴 문장인가 - support-ticket-triage (classify / choice(5) / record, n=30, 작성자 ernestolee13): 이 고객 문의는 어느 분류로 보내야 하는가. 결제: 청구, 환불, 영수증, 구독 요금. 버그: 기능이 설명과 다르게 동작하거나 오류가 난다. 기능 요청: 지금 없는 기능을 원한다. 계정: 로그인, 비밀번호, 이메일 - warmpod-event-gate (classify / binary / record, n=80, 작성자 ernestolee13): 이 후보 기사는 기업 이슈 사례 카드로 올릴 수 있는 기준을 충족하는가. 올릴 수 있는 것은 셋이다. (1) 붙은 기업 자신의 행위나 그로 인한 논란. (2) 붙은 기업에 대한 처분, 판결, 조사, 소송. (3) 붙 ## FAQ **판정 미니벤치가 무엇인가요?** 내 코드의 판정 지점(승인 게이트, 규칙 심사, 라우터, 추출 검증)에서 뽑은 40~100건짜리 이진 또는 다지 문항이다. 지식을 묻지 않고 규칙 준수나 사실 도출만 묻는다. **실행하지 않아도 올릴 수 있나요?** 그렇다. 키가 없으면 벤치만 게시한다. 레지스트리가 기준 팔을 한 번 돌려 결과를 붙인다. 직접 돌리려면 OpenRouter 또는 OpenAI 호환 게이트웨이 하나와 키 하나면 된다. **어떤 모델과 방식으로 실험하나요?** 벤치마다 정확한 모델 슬러그, provider, 확률 출처(logprob, typed, none), 호출 템플릿(max_tokens 1, temperature 0, 추론 끄기, provider 고정), 극성 반전과 셔플, 결정 규칙(이진 0.5, 다지 argmax)을 상세 페이지에 적는다. **얼마나 정확한가요?** 40~60건은 15pp 이상 차이만 보인다. 미세 순위는 내지 않는다. 정확도에 Wilson 95% 구간을 붙이고 AUROC 는 진단용으로만 쓴다. **누가 올렸는지 어떻게 아나요?** 작성자는 GitHub 계정으로 드러나고 생성기 리포에 링크된다. 결과에는 작성자 실행과 레지스트리 실행의 출처 배지가 붙는다. ## Cautions 40~60건은 15pp 이상 차이만 보인다. 미세 순위는 못 낸다. 검증한 게이트웨이는 OpenRouter 뿐이다. 라벨 타당성은 끝까지 사람에 묶인다. ## Tech stack Python 3.9 패키지(bench-core), 의존성 없는 MCP stdio 서버, 정적 HTML 갤러리(Vercel).