콘텐츠로 이동

로컬 LLM 고르기 — 8개 모델을 같은 루프에서 돌려 보니

노트 · 측정

로컬 LLM 고르기 — 8개 모델을 같은 루프에서 돌려 보니

같은 장비, 같은 루프, 같은 문항으로 측정한 로컬 LLM 8종: 기억 능력, 운영 문항, 턴 시간, 근거 없는 숫자, 이름 노출. 용도별 추천.

2026-10-05

veneta는 모델을 고르지 않습니다. 어떤 OpenAI 호환 엔드포인트든 답변을 쓰는 LLM(writer)으로 끼울 수 있습니다. 그래서 자주 받는 질문이 “그럼 어느 모델이 좋으냐”입니다. 답은 “용도에 따라 다르다”인데, 그 다름을 숫자로 적어 둡니다. 모든 행은 같은 장비(DGX Spark 1대), 같은 루프, 같은 문항입니다.

표

모델 (서빙) veneta-bench 12문항(기억 능력), 기억 켬 / 끔 운영 14문항 통과 (검사 선행 전 → 후) 턴 중앙값 근거 없는 숫자 이름 노출
Gemma 4 31B (FP8) 12.0 / 6.0 13.6 → 14.0 50초 0.9 % 0.8 %
OTel 2.0 31B (FP8, 통신 후훈련) 12.0 / 5.7 12.2 → 13.7 49초 4.6 % 5.5 %
Qwen3.8 27B (FP8, 사고 끔) 12.0 / 5.7 12.7 → 13.7 44초 12.0 % 1.3 %
Llama 3.3 70B (FP8) 12.0 / 5.7 6.3 → 13.7 81초 1.0 % 9.8 %
Gemma 4 12B (bf16) 11.7 / 5.0 11.3 → 14.0 61초 4.3 % 2.0 %
EXAONE 4.0.1 32B (bf16, 사고 끔) 11.3 / 5.0 10.3 → 12.7 68초 17.4 % 3.2 %
GLM-4.7 Flash (30B-A3B, bf16, 사고 끔) 10.7 / 5.7 11.3 → 12.7 19초 26.1 % 3.1 %
Mistral Small 3.2 24B (FP8) 10.3 / 5.0 11.3 → 13.3 38초 16.4 % 1.2 %

기억 능력과 운영 문항은 3회 반복 평균(캠페인 3, 2026-09-2830). “검사 선행 전 → 후”는 답을 내보내기 전에 일곱 가지 결정적 검사를 먼저 거치게 한 변경(백서 4장) 전후의 통과 수입니다. 턴 중앙값은 저장된 기억 능력 턴 전부(모델당 2781,938턴, 9-2210-4)의 중앙값으로, 도구 읽기·초안·Critic·재작성을 포함합니다. 마지막 두 열은 도구 호출 신뢰도 노트의 표에서 가져왔습니다(운영 턴 4222,874건).

읽는 법

  • 기억은 저장소가 들고, 모델에 따른 차이는 작습니다. 기억을 켜면 여덟 모델 중 네 개가 12/12이고 가장 낮은 모델도 10.3입니다. 끄면 전부 56입니다. 이 12문항에서 writer 선택은 12문항을 가르고, 저장소 유무는 6문항을 가릅니다.
  • 모델이 크게 갈리는 곳은 두 군데입니다. 시간, 그리고 받은 숫자를 제대로 쓰는가. 턴은 19초(GLM)에서 81초(70B)까지 네 배 차이 납니다. 근거 없는 숫자는 0.9 %(Gemma 31B)에서 26.1 %(GLM)까지 벌어집니다. 빠른 모델은 숫자를 더 자주 지어내고, 검사가 잡아 재작성시키는 만큼 턴이 다시 길어집니다.
  • 검사 선행은 약한 모델을 가장 많이 올립니다. 70B의 6.3 → 13.7이 그 예입니다. 답이 좋아진 게 아니라, 검사에 걸린 초안이 나가지 않게 된 것입니다.
  • 70B는 이 장비에서는 값어치가 없습니다. 12/12로 같은 점수를 81초에 내고, 전원이 두 번 나갔습니다(DGX Spark 운영 노트).

누구에게 무엇을

  • 한국어 통신 운영 질문이면 Gemma 4 31B 또는 OTel 31B. 근거 없는 숫자가 가장 적고 한국어가 안정적입니다. OTel은 통신 용어가 조금 더 자연스럽고 도구 이름이 새는 비율이 높아 검사가 더 자주 손봅니다.
  • 속도가 먼저면 GLM-4.7 Flash. 19초로 가장 빠르지만 네 답 중 하나에 근거 없는 숫자가 들어 검사와 Critic이 그만큼 일합니다. 검사 없이 쓰면 안 됩니다.
  • VRAM이 작은 장비면 Gemma 4 12B. 기억 능력 11.7, 운영 14/14, 다만 61초로 31B보다 느렸습니다(bf16 서빙이라 그렇습니다. FP8이면 다를 수 있습니다).

조건

DGX Spark GB10 1대, vLLM, 모델별 서빙은 표의 괄호대로(FP8은 공개 FP8 체크포인트, bf16은 원본 가중치). 사고(thinking) 모드는 켤 수 있는 모델에서 모두 껐습니다. 기억은 dense 검색, 저장소는 매 실행 같은 상태에서 시작. 턴 시간은 캠페인이 섞여 있어 모델 간 비교에는 쓰되 절대값은 환경을 따릅니다. 도구 호출 신뢰도의 조건은 그 노트에 있습니다. 이 표는 모델의 지능 순위가 아니라 같은 루프에서 보인 행동의 기록입니다. 실행 파일은 v0.1과 함께 공개합니다.

관련 노트: 도구 호출 신뢰도 · DGX Spark 운영 노트 · 벤치마크