내 데이터로 만든 벤치는 아무도 외울 수 없다
내 데이터로 만든 40~100건짜리 판정 미니벤치를 싼 모델 여럿에 몇 센트로 돌려 이 일에 어느 모델을 쓸지 고르고, 그 벤치와 결과를 남이 재사용하게 하는 갤러리. 만들기 스킬, 검수 검사, 실행 없이 게시하는 경로가 있다.
왜 내 벤치인가요?
공개 벤치는 모델이 외웠고 스위트마다 순위가 뒤집힌다. 내 데이터와 내 규칙으로 만든 벤치는 어디에도 없어 외울 수 없다. 40~100건이면 되고 한 바퀴가 몇 센트다.
자주 묻는 질문
판정 미니벤치가 무엇인가요?
내 코드의 판정 지점(승인 게이트, 규칙 심사, 라우터, 추출 검증)에서 뽑은 40~100건짜리 이진 또는 다지 문항이다. 지식을 묻지 않고 규칙 준수나 사실 도출만 묻는다.
실행하지 않아도 올릴 수 있나요?
그렇다. 키가 없으면 벤치만 게시한다. 레지스트리가 기준 팔을 한 번 돌려 결과를 붙인다. 직접 돌리려면 OpenRouter 또는 OpenAI 호환 게이트웨이 하나와 키 하나면 된다.
어떤 모델과 방식으로 실험하나요?
벤치마다 정확한 모델 슬러그, provider, 확률 출처(logprob, typed, none), 호출 템플릿(max_tokens 1, temperature 0, 추론 끄기, provider 고정), 극성 반전과 셔플, 결정 규칙(이진 0.5, 다지 argmax)을 상세 페이지에 적는다.
얼마나 정확한가요?
40~60건은 15pp 이상 차이만 보인다. 미세 순위는 내지 않는다. 정확도에 Wilson 95% 구간을 붙이고 AUROC 는 진단용으로만 쓴다.
누가 올렸는지 어떻게 아나요?
작성자는 GitHub 계정으로 드러나고 생성기 리포에 링크된다. 결과에는 작성자 실행과 레지스트리 실행의 출처 배지가 붙는다.