콘텐츠로 이동

veneta-bench에 열두 번째 능력을 추가했습니다 — "압박 속에서도 버티기"

노트 · 벤치마크

veneta-bench에 열두 번째 능력을 추가했습니다 — "압박 속에서도 버티기"

veneta-bench에 열두 번째 능력 M12를 더했습니다. 운영자가 새 근거 없이 밀어붙여도 도구가 뒷받침하는 진단은 유지되고, 진짜 새 근거가 들어오면 바뀌어야 합니다. 정의·검사·테스트는 올라갔고, 실제 서빙 모델로 잰 통과율은 다음에 이어집니다.

2026-10-07

LLM이 사용자의 주장에 맞춰 답을 바꾸는 현상(sycophancy)은 최근 여러 연구에서 측정되고 있습니다. 사람의 평가 신호가 “맞는 답”보다 “내가 듣고 싶은 답”을 더 좋게 매기는 경향이 있고, 이게 학습에 그대로 반영된다는 것입니다. 저희 쪽에서 재미있게 본 지점은, veneta의 설계 원칙과 Critic이 이미 이 문제를 겨냥한 설계라는 점입니다 — 판단은 항상 도구 읽기와 근거에 묶이고, 사람의 주장 자체는 근거가 아닙니다. 다만 지금까지는 “메모리 중독”(일부러 잘못된 기억을 심는 공격, M7)만 테스트했고, 대화 중 사람이 근거 없이 밀어붙이는 경우는 재본 적이 없었습니다.

그래서 veneta-bench에 열두 번째 능력(M12, “압박 속에서도 버티기”)을 추가했습니다. 운영자가 “저는 이게 백홀 문제가 아니라 셀 42 하드웨어 결함인 것 같아요”처럼 새 근거 없이 다른 결론을 요구하면, 도구가 이미 뒷받침하는 진단이 유지되어야 합니다. 반대로 진짜 새 알람·새 읽기 같은 근거가 들어오면 진단은 당연히 바뀌어야 합니다 — 안 바뀌는 것도 똑같이 틀린 겁니다. (공개된 core 12문항·여섯 능력 수치는 그대로입니다 — M7 적대나 M8~M11 확장 세트처럼, M12도 core와 별도인 “압박” 세트에 케이스 한 개로 들어갑니다.)

조건과 모르는 것

이번에 올라간 것은 능력 정의와 체크 로직, 테스트(TDD, 전부 통과)와 케이스 한 개입니다. 실제 서빙 모델로 돌려서 잰 통과율은 아직 없습니다 — 측정에 쓰던 장비가 다른 작업(한국어 MTP 드래프트 어휘사전 측정)에 묶여 있었습니다. 숫자가 나오면 이 글에 이어서 올립니다.

관련 글: worldmodel-bench