모델 벤치마크

비교

코드부터 산문, 생성된 화면까지 주요 모델을 살펴봐요. 각 질문에 가장 정직하게 답하는 벤치마크로 구성했고, 모든 숫자에는 출처 링크가 있어요.

누가 어디에서 앞서나요

기준일 2026년 8월 28일

올라운드

코딩, 에이전트, 지식, 과학을 모두 합쳤을 때 어떤 모델이 가장 앞서 있나요?

선두권

  1. 1Claude Opus 563
  2. 2Claude Fable 562
  3. 3Grok 4.661

척도 0에서 100까지

하나의 벤치마크는 늘 무언가를 놓치기에, 이 지표는 아홉 개의 어려운 테스트를 한 숫자로 섞습니다. 만능 모델을 찾는다면 여기서 시작하세요. 특정 강점은 다른 차원에서 확인하면 됩니다.

근거

에이전트, 코딩, 일반 지식, 과학적 추론의 네 축에 걸친 아홉 개 테스트로, 각 축이 4분의 1씩 반영됩니다.

지식과 같은 비중으로 에이전트 작업을 평가하는 유일한 복합 지표입니다. 운영사는 작업당 비용과 출력 속도도 함께 공개하며, 이는 점수보다 더 큰 결정 요소가 되곤 합니다.

에이전트와 코드

어떤 모델이 터미널과 저장소에서 실제 작업을, 내가 일일이 고치지 않아도 처리해내나요?

선두권

  1. 1Claude Opus 512.99 %
  2. 2Claude Fable 511.7 %
  3. 3GPT-5.6 Sol10.24 %

척도 0 %에서 16 %까지

높은 아레나 순위는 관찰된 실행에서, 높은 SWE-bench 값은 통과한 테스트 스위트에서 나옵니다. 두 지표를 함께 보면 현실을 꽤 정확히 가늠할 수 있습니다.

근거

사람들이 블라인드 에이전트 실행을 비교하며, 점수는 끝까지 해결된 작업의 비율입니다.

번쩍이는 답변 대신 도구를 쓰는 긴 실행을 측정해, 실제 코딩 에이전트의 작동 방식과 가장 가깝습니다.

SWE-bench VerifiedSWE-bench Team

12개 파이썬 저장소에서 온 500개의 실제 GitHub 이슈입니다. 테스트 스위트를 통과해야 수정으로 인정됩니다.

실제 코드 버그 수정의 오랜 표준이지만 이제 거의 포화 상태로, 최상위 모델들이 96 퍼센트 안팎에 몰려 있습니다. 여기서는 바닥 확인용이며, 차이는 아레나가 보여줍니다.

웹과 UI

어떤 모델이 세련되고 전문적으로 보이며, 다양한 변형에도 견디고 흔한 틀에 박힌 듯하지 않은 화면을 만들어내나요?

선두권

  1. 1Kimi K31,372
  2. 2Muse Spark 1.21,335
  3. 3Claude Opus 51,332

척도 1,200에서 1,450까지

두 보드는 서로 다른 승자를 세웁니다. Design Arena는 Kimi K3를, 투표 수가 더 많은 LMArena WebDev는 Claude Opus 5를 1691점으로 Kimi K3 Max보다 앞세웁니다. 순수한 디자인이 관건이면 Design Arena를, 전체 웹 작업이면 아레나를 더 무겁게 보세요.

근거

사람들이 같은 프롬프트로 나온 두 개의 렌더링 결과물을 비교합니다. 웹사이트, UI 컴포넌트, 데이터 시각화, 3D가 각각 단일 파일로 만들어집니다.

지금까지 유일하게 완성된 렌더링 디자인을 평가하는 벤치마크입니다. 결과물이 세련되었는지, 흔한 AI 만듦새인지가 여기서 드러납니다.

실제 사람들이 낸 웹 개발 프롬프트를 블라인드 비교해 만든 Elo 순위입니다.

웹 벤치마크 중 가장 많은 표를 모았고, Design Arena와 다른 승자를 세웁니다. 바로 그 모순이 둘 다 실은 이유입니다.

글쓰기

어떤 모델이 흔한 구절, 목록, 문단 틀이 아니라 목소리와 리듬이 있는 산문을 쓰나요?

선두권

  1. 1Claude Fable 51,505
  2. 2Claude Opus 4.6 High1,500
  3. 3Gemini 3.7 Flash High1,494

척도 1,350에서 1,600까지

상위 세 모델의 격차가 Elo 11점으로 어느 차원보다 좁아, 여기서 순위는 판결이 아니라 경향입니다. LiveBench는 취향 투표에 신선하고 통제된 과제를 보탭니다.

근거

텍스트 리더보드의 글쓰기 열로, 실제 사용자들이 창의적이고 실무적인 글을 블라인드 비교한 결과입니다.

사람들이 직접 투표하는 자리의 언어 품질이라 속이기 어렵습니다.

답변 패턴이 모델에 새지 않도록 끊임없이 새로운 과제를 내며, 언어와 글쓰기 블록을 포함합니다.

취향 투표의 반대편으로, 낡은 학습 데이터에 흔들리지 않는 통제된 기준입니다.

언어

어떤 모델이 독일어와 한국어를 영어 번역 투가 아니라 모국어처럼 쓰나요?

선두권

  1. 1Gemini 3 Pro1,521
  2. 2Muse Spark 1.21,510
  3. 3Claude Opus 4.6 High1,509

척도 1,400에서 1,600까지

두 보드 모두 번역이 아니라 그 언어로 쓰는 능력을 측정합니다. 승자는 서로 다릅니다. 독일어는 Gemini 3 Pro가, 한국어는 Claude Fable 5가 1501점으로 Claude Opus 5를 앞서며 이끕니다. 이 사이트는 두 언어로 발행되니 두 보드가 모두 중요합니다.

근거

텍스트 리더보드의 독일어 열로, 사용자가 독일어로 낸 과제를 블라인드 비교한 결과입니다.

독일어는 이 사이트의 제1언어입니다. 독일어 사용자가 블라인드 비교에서 누구를 고르는지 보여주는 유일한 보드입니다.

같은 리더보드의 한국어 열로, 영어 열보다 표가 훨씬 적습니다.

한국어는 이 사이트의 세 번째 언어이자 더 어려운 시험대입니다. 학습 데이터도, 표도 적고 오차 범위는 큽니다.

이미지

어떤 모델이 지시에 맞춰 작업하고 스톡 사진을 넘어서는 이미지를 만들어내나요?

선두권

  1. 1GPT Image 21,382
  2. 2Mai Image 2.6 Preview1,331
  3. 3Grok Imagine 2.01,316

척도 1,200에서 1,450까지

미적 감각은 단위 테스트로 검증할 수 없기에, 여기서는 많은 사람이 결정합니다. 캠페인과 로고는 Design Arena와 LMArena의 SVG 및 로고 카테고리에서 따로 확인할 수 있습니다.

근거

블라인드 짝 비교로, 같은 프롬프트에서 나온 두 이미지 중 한 표가 결정합니다.

연구실 마케팅과 별개로 실제 이용 목적에 맞춘 이미지 품질을 측정하는 유일한 대표본입니다.

시각

어떤 모델이 브라우저 작업에서 스크린샷, 차트, 긴 문서를 충분히 믿을 만하게 읽어내나요?

선두권

  1. 1Claude Fable 51,313
  2. 2Claude Opus 4.7 High1,301
  3. 3Qwen 3.8 Max1,300

척도 1,200에서 1,400까지

비전은 픽셀 단위 디자인 검토를 대신하지 않지만, 어떤 스크린샷을 직접 볼 가치가 있는지 믿을 만하게 가려줍니다.

근거

차트, 화면, 문서 등 이미지 과제를 블라인드로 비교합니다.

브라우저나 도구에서 스크린샷을 다룰 때의 일상 테스트입니다.

실제 사무 환경이 남기는 길고 지저분한 파일을 대상으로 한 문서 이해력 측정입니다.

스크린샷을 보충해 PDF, 양식, 계약서 같은 일상 자료의 다른 절반을 다룹니다.

버릇

측정한 게 아니라 매일 쓰면서 적어 둔 것들이에요. 패턴이라 부를 만큼 반복된 것만 싣고, 화살표는 그 버릇이 제약하는 차원으로 이어져요.

Claude Opus 5

Anthropic

사적인 어휘글쓰기

똑똑하게 들리려다 오히려 읽기 어려워집니다. 용어를 만들어 내고, 생각을 추상어로 눌러 담고, load bearing이나 gates 같은 말을 입에 달고 삽니다. 커뮤니티는 이를 Claudisms라고 부릅니다.

GPT-5.6 Sol

OpenAI

코드를 너무 많이 쓰고 모든 줄을 테스트로 덮어, 정작 중요한 변경이 테스트 소음에 묻힙니다. 출시 당시 리뷰어들도 오버엔지니어링이라 불렀습니다.

Gemini 3 Pro

Google

추론은 훌륭한데 실행에서 넘어집니다. 계획서가 그 결과물인 패치보다 잘 읽힙니다.

Kimi K3

Moonshot AI

문서가 필요웹과 UI

컨텍스트에 문서가 있으면 강하고, 없으면 밋밋해집니다. 중국어는 최상급이지만 영어는 무난한 수준입니다.

선정 과정

제 작업에서 실제로 결정적인 것만 세트에 담았어요. Intelligence Index는 폭을 재는 나침반이고, 아레나는 취향 테스트, SWE-bench와 LiveBench는 취향 투표와 낡은 과제를 걸러내는 장치예요.

Elo 표는 사람의 선호를 반영해요. 상위 순위는 옳다는 뜻이 아니라 자주 선호된다는 뜻이에요. 모델은 기록된 최고 effort 단계로 실리고, 복합 지표는 여러 테스트를 묶어 각각 링크해요.

출처

숫자는 이 리더보드에서 왔고, 기준일에 기록해 수동으로 관리해요.