로컬 LLM 고르기 — 8개 모델을 같은 루프에서 돌려 보니
노트 · 측정
로컬 LLM 고르기 — 8개 모델을 같은 루프에서 돌려 보니
같은 장비, 같은 루프, 같은 문항으로 측정한 로컬 LLM 8종: 기억 능력, 운영 문항, 턴 시간, 근거 없는 숫자, 이름 노출. 용도별 추천.
2026-10-05
veneta는 모델을 고르지 않습니다. 어떤 OpenAI 호환 엔드포인트든 답변을 쓰는 LLM(writer)으로 끼울 수 있습니다. 그래서 자주 받는 질문이 “그럼 어느 모델이 좋으냐”입니다. 답은 “용도에 따라 다르다”인데, 그 다름을 숫자로 적어 둡니다. 모든 행은 같은 장비(DGX Spark 1대), 같은 루프, 같은 문항입니다.
표
| 모델 (서빙) | veneta-bench 12문항(기억 능력), 기억 켬 / 끔 | 운영 14문항 통과 (검사 선행 전 → 후) | 턴 중앙값 | 근거 없는 숫자 | 이름 노출 |
|---|---|---|---|---|---|
| Gemma 4 31B (FP8) | 12.0 / 6.0 | 13.6 → 14.0 | 50초 | 0.9 % | 0.8 % |
| OTel 2.0 31B (FP8, 통신 후훈련) | 12.0 / 5.7 | 12.2 → 13.7 | 49초 | 4.6 % | 5.5 % |
| Qwen3.8 27B (FP8, 사고 끔) | 12.0 / 5.7 | 12.7 → 13.7 | 44초 | 12.0 % | 1.3 % |
| Llama 3.3 70B (FP8) | 12.0 / 5.7 | 6.3 → 13.7 | 81초 | 1.0 % | 9.8 % |
| Gemma 4 12B (bf16) | 11.7 / 5.0 | 11.3 → 14.0 | 61초 | 4.3 % | 2.0 % |
| EXAONE 4.0.1 32B (bf16, 사고 끔) | 11.3 / 5.0 | 10.3 → 12.7 | 68초 | 17.4 % | 3.2 % |
| GLM-4.7 Flash (30B-A3B, bf16, 사고 끔) | 10.7 / 5.7 | 11.3 → 12.7 | 19초 | 26.1 % | 3.1 % |
| Mistral Small 3.2 24B (FP8) | 10.3 / 5.0 | 11.3 → 13.3 | 38초 | 16.4 % | 1.2 % |
기억 능력과 운영 문항은 3회 반복 평균(캠페인 3, 2026-09-2830). “검사 선행 전 → 후”는 답을 내보내기 전에 일곱 가지 결정적 검사를 먼저 거치게 한 변경(백서 4장) 전후의 통과 수입니다. 턴 중앙값은 저장된 기억 능력 턴 전부(모델당 2781,938턴, 9-2210-4)의 중앙값으로, 도구 읽기·초안·Critic·재작성을 포함합니다. 마지막 두 열은 도구 호출 신뢰도 노트의 표에서 가져왔습니다(운영 턴 4222,874건).
읽는 법
- 기억은 저장소가 들고, 모델에 따른 차이는 작습니다. 기억을 켜면 여덟 모델 중 네 개가 12/12이고 가장 낮은 모델도 10.3입니다. 끄면 전부 5
6입니다. 이 12문항에서 writer 선택은 12문항을 가르고, 저장소 유무는 6문항을 가릅니다. - 모델이 크게 갈리는 곳은 두 군데입니다. 시간, 그리고 받은 숫자를 제대로 쓰는가. 턴은 19초(GLM)에서 81초(70B)까지 네 배 차이 납니다. 근거 없는 숫자는 0.9 %(Gemma 31B)에서 26.1 %(GLM)까지 벌어집니다. 빠른 모델은 숫자를 더 자주 지어내고, 검사가 잡아 재작성시키는 만큼 턴이 다시 길어집니다.
- 검사 선행은 약한 모델을 가장 많이 올립니다. 70B의 6.3 → 13.7이 그 예입니다. 답이 좋아진 게 아니라, 검사에 걸린 초안이 나가지 않게 된 것입니다.
- 70B는 이 장비에서는 값어치가 없습니다. 12/12로 같은 점수를 81초에 내고, 전원이 두 번 나갔습니다(DGX Spark 운영 노트).
누구에게 무엇을
- 한국어 통신 운영 질문이면 Gemma 4 31B 또는 OTel 31B. 근거 없는 숫자가 가장 적고 한국어가 안정적입니다. OTel은 통신 용어가 조금 더 자연스럽고 도구 이름이 새는 비율이 높아 검사가 더 자주 손봅니다.
- 속도가 먼저면 GLM-4.7 Flash. 19초로 가장 빠르지만 네 답 중 하나에 근거 없는 숫자가 들어 검사와 Critic이 그만큼 일합니다. 검사 없이 쓰면 안 됩니다.
- VRAM이 작은 장비면 Gemma 4 12B. 기억 능력 11.7, 운영 14/14, 다만 61초로 31B보다 느렸습니다(bf16 서빙이라 그렇습니다. FP8이면 다를 수 있습니다).
조건
DGX Spark GB10 1대, vLLM, 모델별 서빙은 표의 괄호대로(FP8은 공개 FP8 체크포인트, bf16은 원본 가중치). 사고(thinking) 모드는 켤 수 있는 모델에서 모두 껐습니다. 기억은 dense 검색, 저장소는 매 실행 같은 상태에서 시작. 턴 시간은 캠페인이 섞여 있어 모델 간 비교에는 쓰되 절대값은 환경을 따릅니다. 도구 호출 신뢰도의 조건은 그 노트에 있습니다. 이 표는 모델의 지능 순위가 아니라 같은 루프에서 보인 행동의 기록입니다. 실행 파일은 v0.1과 함께 공개합니다.
관련 노트: 도구 호출 신뢰도 · DGX Spark 운영 노트 · 벤치마크
