벤치마크
벤치마크
측정한 것을 모두 공개합니다.
veneta 벤치마크 세트는 메모리, 판단, 자가 개선 레이어를 코드로 채점하는 자체 벤치마크 모음입니다. 사람이 채점하지 않습니다. 저장된 답변은 언제든 다시 채점할 수 있습니다. 모든 수치는 3회 반복 평균이며 백서의 수치와 같습니다.
마지막 갱신 2026-10-02 · 캠페인 3 (2026년 9월 28~30일) · 메모리 레이어 4종 (10월 1~2일, 한 제품은 일부 측정 중)
veneta WorldModel 카드
월드모델 전체를 열 축과 네 관문으로 재는 벤치마크 제안입니다. 비교할 상대가 아직 없어 veneta WorldModel의 카드부터 올립니다. 점수는 전부 코드가 매기고, 숫자마다 조건이 붙으며, 종합 점수는 없습니다. 통신 에디션에서 지금까지 측정한 값과 아직 못 잰 것은 제안 페이지에 있습니다.
메모리 축 — veneta-bench와 벤치마크 세트
열 축 가운데 메모리 축을 재는 veneta-bench(기억 능력 벤치마크, 12문항)와 같은 루프의 다른 세트입니다. 아래 결과는 모두 이 축의 것입니다.
벤치마크 세트
veneta-bench (기억 능력 벤치마크)
12문항, 여섯 가지 능력
지난번에 무엇을 결정했는지 기억하는가 · 기억한 숫자보다 오늘의 측정값을 우선하는가 · 승인된 수정이 다음 세션을 바꾸는가 · 거절된 규칙이 다시 나오지 않는가 · 답변이 담당자 취향이 아니라 기록을 인용하는가 · 메모리 속 잡담이 운영 답변에 섞이지 않는가. 메모리 레이어가 없는 모델은 이 중 셋에서 구조적으로 0점입니다.
운영 질문
14문항
장애, 최적화, 양자 결과, 잡담, 데이터 없음. 코드 기반 검사 일곱 가지(근거, 길이, 시뮬레이션 표기, 양자 표기, 잡담 오염, 도구 사용, 내부 이름 노출)와 Critic 모델의 판정.
적대 케이스
4문항
메모리에 심어 둔 지시문, 비밀값, 링크가 답변에 새어 나오지 않는지.
장기·이중언어
16문항
여러 세션에 걸친 결정 기억과 한국어·영어 혼용 질문.
연쇄
8문항
앞의 결론이 다음 질문의 전제가 되는 다단계 질문.
바늘 찾기
720 쿼리
검색 품질만 따로: 수천 행 중에서 맞는 한 행을 찾는 비율(hit@k, MRR).
그림 1. 메모리 OFF와 ON
오픈 모델 8종, 같은 판단 레이어 위에서 메모리 레이어만 OFF/ON 한 결과. 모든 모델이 1.9~2.3배.
표로 보기
| 모델 | 크기 | OFF | ON | 배율 |
|---|---|---|---|---|
| Gemma 4 31B | 31B | 6 | 12 | 2.00× |
| OTel 2.0 31B | 31B | 5.7 | 12 | 2.11× |
| Gemma 4 12B | 12B | 5 | 11.7 | 2.34× |
| Qwen3.8 27B | 27B | 5.7 | 12 | 2.11× |
| Mistral Small 3.2 24B | 24B | 5 | 10.3 | 2.06× |
| EXAONE 4.0.1 32B | 32B | 5 | 11.3 | 2.26× |
| GLM-4.7 Flash | 30B-A3B | 5.7 | 10.7 | 1.88× |
| Llama 3.3 70B | 70B | 5.7 | 12 | 2.11× |
모델별 전체 표
운영 질문 14문항은 판단 레이어 적용 전후(2026-09-25 엔진 → 09-29 엔진, 코드 기반 검사가 Critic 판정보다 앞섬)로, 메모리 12문항은 메모리 레이어 유무로 측정했습니다.
| 모델 | 크기 | 운영 14 · 전 | 운영 14 · 후 | 기억 12 · OFF | 기억 12 · ON | 배율 |
|---|---|---|---|---|---|---|
| Gemma 4 31B | 31B | 13.6 / 14 | 14 / 14 | 6 / 12 | 12 / 12 | 2.0× |
| OTel 2.0 31B | 31B | 12.2 / 14 | 13.7 / 14 | 5.7 / 12 | 12 / 12 | 2.1× |
| Gemma 4 12B | 12B | 11.3 / 14 | 14 / 14 | 5 / 12 | 11.7 / 12 | 2.3× |
| Qwen3.8 27B | 27B | 12.7 / 14 | 13.7 / 14 | 5.7 / 12 | 12 / 12 | 2.1× |
| Mistral Small 3.2 24B | 24B | 11.3 / 14 | 13.3 / 14 | 5 / 12 | 10.3 / 12 | 2.1× |
| EXAONE 4.0.1 32B | 32B | 10.3 / 14 | 12.7 / 14 | 5 / 12 | 11.3 / 12 | 2.3× |
| GLM-4.7 Flash | 30B-A3B | 11.3 / 14 | 12.7 / 14 | 5.7 / 12 | 10.7 / 12 | 1.9× |
| Llama 3.3 70B | 70B | 6.3 / 14 | 13.7 / 14 | 5.7 / 12 | 12 / 12 | 2.1× |
측정 방법
- 장비. NVIDIA DGX Spark 1대 (GB10, 통합 메모리 128 GB). vLLM, FP8, 16k 컨텍스트, 도구 호출 ON, thinking 모드 OFF.
- 모델. Gemma 4 31B · Gemma 4 12B (Google) · OTel 2.0 31B (통신 특화 후속 학습) · Qwen3.8 27B (Alibaba) · Mistral Small 3.2 24B · EXAONE 4.0.1 32B (LG AI Research) · GLM-4.7 Flash (Zhipu) · Llama 3.3 70B (Meta). 모두 공개 가중치 모델.
- 데이터. 통신 에디션의 합성 운영 데이터(셀, 백홀, 알람, 토폴로지, SLA). 실제 통신사 데이터는 쓰지 않았습니다.
- 채점. 전부 코드로. 조건마다 3회 반복, 평균과 [범위]. 0.3 차이는 오차 범위입니다.
모델별 도구 호출(자체 호출, 없는 도구, 읽지 않음, 근거 없는 숫자, 이름 노출)은 저장된 9,759턴에서 따로 집계했습니다: 로컬 모델은 도구를 얼마나 제대로 부르나 — 8개 모델, 9,759턴
월드모델 전체를 재는 벤치마크는 따로 제안합니다(veneta-bench가 메모리 축): worldmodel-bench v0.2 · 제안 — 월드모델을 열 축과 네 관문으로 측정합니다
다른 메모리 레이어와의 비교
널리 쓰이는 오픈소스 메모리 레이어 4종을 같은 판단 레이어 아래 검색 엔진으로 끼워 같은 모델(Gemma 4 31B), 같은 장비, 같은 문항으로 측정했습니다. 제품 이름은 논문에서만 밝힙니다. 넘김 = veneta 팀이 정리한 기록을 그대로 넘겨준 경우, 추출 = 그 레이어가 세션 기록에서 스스로 추출한 경우. 외부 제품 셀은 1회 측정(한 제품은 3회)이고, "측정 중"은 아직 측정하는 중입니다.
| veneta | A | B | C | D | |
|---|---|---|---|---|---|
| 메모리 능력 12문항 (넘김 / 추출) | 12 | 11.7 / 8.0 | 12 / 8 | 12 / 7 | 7 / 7 |
| 장기·이중언어 16문항 (넘김 / 추출) | 16 | 14.0 / 6.7 | 13 / 5 | 13 / 5 | 측정 중 |
| 적대 4문항 (넘김 / 추출) | 4 | 4 / 4 | 4 / 3 | 4 / 4 | 3 / 3 |
| 연쇄 8문항 | 8 | 8 | 8 | 8 | 측정 중 |
| 메모리 검색 중앙값 (ms) | 7 | 32–40 | 199–292 | 32–33 | 45 |
다른 제품은 이름 대신 A·B·C·D로 적었고, 순서는 항상 같습니다. 넘김은 veneta 팀이 미리 정리한 기록을 그 제품에 그대로 넘겨준 경우입니다. 추출은 그 제품이 대화 내용을 읽고 기억할 것을 스스로 골라낸 경우입니다. 실제 사용 환경에서는 제품이 스스로 골라내야 하므로, 추출 점수가 실제 사용에 가깝습니다.
veneta 위키 스토어 어댑터. 같은 루프에서 저장소만 위키 페이지(주제별 마크다운, 인덱스, 변경 로그)로 바꾼 veneta 팀의 어댑터입니다. 기록을 그대로 저장한 경우 넘김 12/12 · 추출 10/12, 모델이 저장 시점에 주제 페이지로 정리한 경우 10/12 · 9/12. 적재 시간은 문항당 <0.1초 대 35초. 검색 벤치 적중률 96.9 % · 92.1 %(veneta 하이브리드 검색 98.8 %), 검색 중앙값 6~7 ms. 보안 테스트는 외부 제품과 같은 결과(심어 둔 지시문과 비밀값이 저장되고 그대로 반환됨, 원장 없음). 1회 측정, Gemma 4 31B, 장비 1대, 2026-10-04.
실행 파일 (검색 벤치와 보안 테스트): recall-bench-wiki-rows-gemma-4-31b-fp8.json · recall-bench-wiki-compiled-gemma-4-31b-fp8.json · security-wiki.json. 12문항 실행 파일은 논문과 함께 공개합니다.
공개 벤치마크
veneta-bench(기억 능력 벤치마크, 12문항)는 veneta 팀이 직접 만든 것입니다. 그래서 공개 장기 대화 벤치마크에서도 veneta를 측정합니다: LongMemEval-S(500문항, 공식 데이터와 채점 스크립트), LoCoMo(대화 10개, 약 2,000문항, 공식 지표), 시간이 되면 BEAM. 같은 모델, 메모리 OFF와 ON, 논문에서 쓰는 기준선, 채점 모델, 원인, 알게 된 점을 명시합니다.
LongMemEval-S · 500 문항 · accuracy (official judge prompts, yes/no) · 채점: gpt-4o · 장비: DGX Spark GB10 (one machine, vLLM) · 컨텍스트: 16k · 2026-10-03
검색 설정(k, 이웃 턴, 추가 질의, 블록 크기, 지시문)은 500문항 중 60문항(25번째마다, 세 묶음)으로 골랐고, 설정마다 500문항 전체를 1회 돌렸습니다. 고르는 데 쓰지 않은 440문항의 점수도 함께 적습니다.
데이터셋, 심판 프롬프트(저자들의 evaluate_qa.py 원본 그대로), 심판 모델(GPT-4o)은 벤치마크 것입니다. 측정 대상인 메모리 레이어, 로더·러너 코드, 그리고 답과 판정이 들어 있는 실행 파일입니다. 문항마다 그 문항의 대화만 담은 빈 인메모리 저장소에서 시작해 끝나면 버립니다. Critic, 규칙 학습, 원장은 꺼져 있어 문항 사이에도 실행 사이에도 남는 것이 없고, 실행 사이에 바뀐 것은 위에 적은 우리 설정뿐입니다.
알게 된 점. 점수는 답변을 쓰는 LLM(writer)의 크기보다 메모리 블록과 읽는 방식이 정했다(같은 메모리: 로컬 31B 87.2, 클라우드 소형 83.2, 블록 절반의 GPT-4o 77.6). 검색은 거의 잃지 않았고(근거 포함 97 ~ 98 %) 남은 오답은 세기·날짜 계산·근거 있는 기권. 지식 갱신은 날짜 붙인 나열이 단일 값보다 심판을 통과. 오답을 본 뒤의 지시문 수정은 테스트 셋을 본 것이라 표기. 16k 무메모리 기준선은 바닥.
다음 단계. 저장 시 모델 정리(위키 저장소 compiled 모드)는 veneta-bench 12문항에서 측정(넘김 10/12·추출 9/12 대 12/12·10/12, 적재 35초 대 0.1초) — 같은 비교를 LongMemEval에서; 세기 질문엔 2차 회상과 개체별 시간순 목록; 날짜 질문엔 날짜 계산 도구; 근거 있는 기권 줄이기; 설정 동결 후 LoCoMo 1회; 반복 3회; 비교 대상 레이어를 답변을 쓰는 같은 LLM(writer) 아래에서 직접 실행; 70B 로컬 writer 행은 보류(하드웨어).
| 모델 | 메모리 OFF | veneta ON | 전체 컨텍스트 |
|---|---|---|---|
| gemma-4-31b-fp8 (local) · 1회 실행 16k context; memory block ≤ 36k chars; memory off = newest 40k chars rows as-is (no LLM extraction), hybrid recall k40 + 6 local-model queries fused by RRF, 1 neighbour turn, block ≤ 36k chars; memory off = newest 40k chars of the transcript 유형별: single-session-user 94.3 · single-session-assistant 98.2 · multi-session 75.9 · temporal-reasoning 78.2 · knowledge-update 94.9 · single-session-preference 93.3 | 15.2 % 튜닝에 쓰지 않은 440문항: 14.8 % | 85.6 % 튜닝에 쓰지 않은 440문항: 84.5 % 튜닝에 쓴 60문항: 93.3 % | 16k 컨텍스트에서는 불가, 표기만 |
| gemma-4-31b-fp8 (local), prompt v6 · 1회 실행 16k context; memory block ≤ 36k chars same retrieval and block as the row above; writer prompt revised after reading the first full run's failures (wrong abstentions 32 → 22), so this prompt is informed by the test set — a second configuration, not a replacement 유형별: single-session-user 95.7 · single-session-assistant 98.2 · multi-session 79.0 · temporal-reasoning 82.7 · knowledge-update 94.9 · single-session-preference 83.3 | 15.2 % | 87.2 % 튜닝에 쓰지 않은 440문항: 85.7 % 튜닝에 쓴 60문항: 98.3 % | 16k 컨텍스트에서는 불가, 표기만 |
| GPT-4o writer over the same veneta memory · 1회 실행 writer context 128k; memory block ≤ 20k chars same retrieval (k40 + 6 queries, 1 neighbour) but memory block ≤ 20k chars (29 rows median vs 53) because of the provider's 10k-tokens/min tier; terse single-value answers lost knowledge-update and preference points that the local writer's dated listings earned 유형별: single-session-user 95.7 · single-session-assistant 98.2 · multi-session 64.7 · temporal-reasoning 77.4 · knowledge-update 76.9 · single-session-preference 56.7 | 측정 중 | 77.6 % 튜닝에 쓰지 않은 440문항: 77.0 % 튜닝에 쓴 60문항: 81.7 % | 16k 컨텍스트에서는 불가, 표기만 |
| llama-3.3-70b-fp8 writer (local) over the same memory, 36k block same retrieval and block as the gemma row; paused at 78/500: the machine lost power twice under the 70B's load (a thermal cut-off in the power stage); resumes on another unit | 측정 중 | (paused — hardware) | 16k 컨텍스트에서는 불가, 표기만 |
| claude-haiku-4.5 writer over the same memory, 36k block (the comparison figure's answering model) · 1회 실행 writer context 200k; memory block ≤ 36k chars same retrieval, block and prompt as the local v6 row; only the writer differs — the model the compared layer's maker reports using to answer; it abstained on 76 items (29 wrongly) against the local writer's 22 wrong abstentions 유형별: single-session-user 95.7 · single-session-assistant 98.2 · multi-session 72.9 · temporal-reasoning 77.4 · knowledge-update 91.0 · single-session-preference 76.7 | 측정 중 | 83.2 % 튜닝에 쓰지 않은 440문항: 81.8 % 튜닝에 쓴 60문항: 93.3 % | 16k 컨텍스트에서는 불가, 표기만 |
실행 파일 (답변 500개와 판정): longmemeval-gemma-4-31b-fp8-memoff-full-2026-10-03.json · longmemeval-gemma-4-31b-fp8-memon-v4-k40n1q6b36-full-2026-10-03.json · longmemeval-gpt-4o-memon-v4-k40n1q6b20-full-2026-10-03.json · longmemeval-gemma-4-31b-fp8-memon-v6-k40n1q6b36-full-2026-10-03.json · longmemeval-claude-haiku-4-5-memon-v6-k40n1q6b36-full-2026-10-03.json
널리 알려진 오픈소스 메모리 레이어 중 한 제품이 발표한 점수: LongMemEval-S: 90.4 % (채점: LLM-as-judge; judge model and prompt not named (their report)). 제조사가 자체 보고한 수치이며 조건(모델, 채점, 장비)이 같지 않습니다. 제품 이름은 논문에서 밝힙니다.
주장하지 않는 것
- "할루시네이션을 없앤다"고 말하지 않습니다. 근거 없는 숫자와 빠진 표기를 코드로 잡아 다시 쓰게 할 뿐이고, 잡히지 않은 것은 그대로 남습니다.
- "최고"라고 말하지 않습니다. 검색 품질만 보면 다른 제품이 같거나 앞서는 항목이 있습니다.
- 실제 고객 데이터로 측정하지 않았습니다. 다른 산업의 수치는 없습니다.
- 작은 실험입니다. 14 + 12문항, 3회 반복, 장비 1대.
- 판단 레이어에는 비용이 있습니다. 작은 모델에서 턴 중앙값이 15초 늘었습니다.
- 사람이 승인해야 합니다. 승인 단계를 빼면 보안 표는 더 이상 성립하지 않습니다.
- 아직 논문 피어 리뷰를 받지 않았습니다. 논문에서 데이터가 바뀌면 이 페이지의 벤치마크 데이터도 함께 바뀝니다.
직접 벤치마크 돌려 보기
v0.1과 함께 프로토콜, 테스트 케이스, 채점 코드가 공개됩니다. veneta bench는 내 모델로 veneta-bench(12문항)와 공개 벤치마크(LongMemEval-S, LoCoMo, BEAM)를 돌리고, 결과는 veneta bench --share로 보냅니다. 나머지 세트의 하네스도 같은 날 공개합니다. 외부 재현 결과는 이 페이지에 그대로 올립니다. 결과는 메일로 보내도 됩니다: [email protected]
다음 단계
더 많은 모델을 계속 측정합니다. 새 결과가 나올 때마다 이 페이지와 릴리스를 갱신합니다.
