노트
노트
노트
veneta를 만드는 사람들이 쓴 긴 글입니다. 무엇과 비교했고, 무엇을 직접 해 봤고, 무엇을 측정했는지. 모든 수치에 조건이 붙어 있고, 측정하지 못한 것은 그렇다고 적습니다.
2026-10-05
worldmodel-bench v0.2 · 제안 — 월드모델을 열 축과 네 관문으로 측정합니다
월드모델을 재는 일곱 축과 여덟 가지 운영 조건 게이트, 오늘 측정할 수 있는 것과 아직 아닌 것을 적은 제안. veneta-bench가 일곱째 축입니다. 종합 점수는 없습니다.
2026-10-05
에이전트 세션을 나누고, 메모리 레이어로 잇기 — 두 주의 기록
한 저장소에 에이전트 세션 10개를 두 주 동안: 세션마다 워크트리, 공유 폴더와 복사본, 그리고 세션이 배운 것을 남기는 메모리 레이어. 잘된 것과 걸린 것.
2026-10-05
같은 31B 모델이 두 배 빨라졌습니다 — Gemma 4 드래프터로 추측 디코딩 켜기
추측 디코딩(Google의 Gemma 4 드래프터)으로 같은 31B가 약 두 배 빨라졌습니다: 13.5~13.8 대 6.3~6.4 tok/s, 기억 능력 12/12, 턴 중앙값 23초 대 50초, vLLM 플래그 하나.
2026-10-05
로컬 LLM 고르기 — 8개 모델을 같은 루프에서 돌려 보니
같은 장비, 같은 루프, 같은 문항으로 측정한 로컬 LLM 8종: 기억 능력, 운영 문항, 턴 시간, 근거 없는 숫자, 이름 노출. 용도별 추천.
2026-10-05
DGX Spark 1대로 두 주 — 전원이 나가고, 클럭이 걸리고, 70B는 포기한 이야기
70B 실행 중 두 번 나간 전원, 507 MHz에 걸린 클럭과 완전 방전으로 푸는 방법, 디코딩 프로브로 확인하는 방법, veneta 팀이 정한 규칙.
2026-10-04
로컬 모델은 도구를 얼마나 제대로 부르나 — 8개 모델, 9,759턴
저장된 실행 9,759턴에서 집계한 모델별 도구 호출: 자체 호출, 없는 도구, 읽지 않음, 근거 없는 숫자, 이름 노출.
2026-10-03
RAG, LLM 위키, 그리고 veneta
무엇이 다르고, 같이 쓰면 어떻게 되나
2026-10-03
LLM 위키를 직접 써 봤습니다
잘된 장면 하나, 잘못된 장면 하나, 그리고 거기서 나온 설계
