우리 업무에 맞는 LLM, 한국어 시험지로 고르세요
계약서 검토, 진료 기록 요약, 공시 해석처럼 실제 국내 업무에 가까운 과제로 모델을 채점하는 리더보드를 준비하고 있습니다.
출시 전, 대기자를 모집하고 있습니다
설명을 위한 가상 예시입니다. 실제 측정 결과가 아닙니다.
도메인마다 순위가 다릅니다
옆으로 넘기면 의료, 금융 순위가 이어집니다.
법률계약서 검토
- 1모델 다78.4오차 범위 ±1.9영어보다 2계단 위
- 2모델 마74.9오차 범위 ±2.2영어보다 3계단 위
- 3모델 가73.1오차 범위 ±2.0영어보다 2계단 아래
- 4모델 라66.0오차 범위 ±2.6변동 없음
- 5모델 나61.7오차 범위 ±2.4영어보다 3계단 아래
의료진료 기록 요약
- 1모델 가81.2오차 범위 ±1.7변동 없음
- 2모델 다77.5오차 범위 ±2.1영어보다 1계단 위
- 3모델 라72.8오차 범위 ±2.3영어보다 1계단 위
- 4모델 나70.3오차 범위 ±2.0영어보다 2계단 아래
- 5모델 마64.9오차 범위 ±2.8변동 없음
금융공시 주석 해석
- 1모델 마76.8오차 범위 ±2.2영어보다 4계단 위
- 2모델 가75.0오차 범위 ±1.9영어보다 1계단 아래
- 3모델 나71.6오차 범위 ±2.4영어보다 1계단 아래
- 4모델 다69.2오차 범위 ±2.5영어보다 1계단 아래
- 5모델 라58.4오차 범위 ±3.0영어보다 1계단 아래
모델을 고를 때 막히는 곳
영어 벤치마크 1등이 한국어 업무에서도 1등이라는 보장이 없습니다
공개 순위표는 대부분 영어 문제로 매겨집니다. 존댓말, 한자어, 국내 법령 용어가 섞인 문서에서는 순위가 달라지기도 합니다.
우리 도메인에서 쓸 만한지는 결국 직접 돌려 봐야 압니다
모델을 바꿀 때마다 사내 샘플을 모으고, 프롬프트를 맞추고, 결과를 사람이 읽어 비교하느라 몇 주가 걸립니다.
모델사가 내놓는 점수는 서로 조건이 달라 비교하기 어렵습니다
각자 고른 데이터셋과 설정으로 잰 점수라서, 같은 표에 놓고 보면 무엇이 더 나은지 판단하기 어렵습니다.
이렇게 비교할 계획입니다
한국어 실무 과제로 시험지를 만듭니다
법률·의료·금융 분야의 실제 문서 형식을 본뜬 한국어 과제를 도메인 전문가와 함께 설계할 계획입니다.
모든 모델을 같은 조건으로 채점합니다
같은 프롬프트와 설정으로 돌리고, 채점 기준과 방법을 공개할 계획입니다.
도메인별 순위를 나란히 비교합니다
관심 있는 모델 두세 개를 골라 과제별 점수와 답변을 나란히 볼 수 있게 만들 계획입니다.
이런 팀을 위해 만듭니다
모델을 고르는 기업 AI 팀
사내 챗봇, 문서 검토, 상담 자동화에 쓸 모델을 정해야 하는데, 한국어·우리 업계 기준의 근거가 필요한 팀
모델을 만드는 국내 모델사
한국어와 국내 도메인에서의 강점을 같은 조건의 제3자 비교로 보여 주고 싶은 팀
첫 리더보드 공개 소식을 먼저 받아 보세요
업무용 이메일을 남겨 주시면 첫 도메인 리더보드를 공개할 때 알려 드립니다. 광고 메일은 보내지 않습니다.
자주 묻는 질문
문 1.지금 바로 쓸 수 있나요?
아직 출시 전입니다. 첫 도메인 리더보드를 공개하면 대기자 명단에 먼저 알려 드립니다.
문 2.어떤 모델과 도메인부터 다루나요?
국내외에서 많이 쓰는 상용·공개 모델을 우선 다루고, 도메인은 법률·의료·금융부터 시작할 계획입니다.
문 3.특정 모델사에 유리하게 운영되지 않나요?
채점 기준과 방법을 공개하고, 어느 모델사도 결과를 미리 보거나 고칠 수 없게 운영할 계획입니다. 유출을 막기 위해 과제 일부는 공개하지 않을 수 있습니다.