<aside> 🌏 English edition — Taking Judgment Out of the LLM — Wiring a System One Model into a CLI Agent
</aside>
<aside> 📚 시리즈 2편이 나왔습니다 — AOT 바이너리 안에서 액터를 돌리다 — agent-one의 Bot/Loop 쌍이 실제로 작동하는 방식 · 이 글의 전제 하나("Akka는 Native AOT를 못 넘는다")가 하루 만에 뒤집힌 기록이기도 합니다.
</aside>
<aside> 🎯 3줄 요약 — ① 에이전트 루프의 판단 지점(웹이냐 파일이냐, 이 명령을 실행해도 되냐, 이 초안으로 충분하냐)을 LLM에게 물으면 느리고 흔들린다. ② 텍스트 대신 타입이 있는 판단 + 보정된 confidence 를 돌려주는 분류기(TypeSafe Jev)를 그 자리에 꽂았다. ③ 스마트 모드 오버헤드 15초 → 0.9초. 다만 이득의 본질은 속도가 아니라 "자동으로 해도 되는가"를 코드가 판단할 수 있게 된 것이다.
</aside>
대상 독자: 에이전트 루프를 직접 만들어 본 개발자. 실측값은 전부 저전력 미니 PC 한 대에서 온디바이스로 돌린 세션 로그에서 나온 것이고, 벤치마크가 아니다.
<aside>
📌 이 글의 기준 시점은 2026-09-22입니다 (작성 2026-09-23). 대상은 agent-one v0.3.27(AgentZeroLite 저장소, 브랜치 feat/agent-one, 개발 진행 중)이고, 아래 실측은 모두 2026-09-22 세션 로그에서 나왔다. TypeSafe Jev는 바로 그날 얼리액세스로 공개됐다 — 즉 출시 당일에 붙여 본 기록이라, API 형태·요금·모델 동작이 언제든 바뀔 수 있다. 수치는 시점값으로 읽어야 한다. 외부 출처는 전부 2026-09-22에 확인했다.
</aside>
먼저 인정할 것이 있다. 프론티어 모델만 쓰는 환경이라면 이 글의 절반은 쓸 이유가 없다. 답변 자체가 몇 초에 끝나는데 라우팅 판단 0.3초를 아끼자고 분류기를 하나 더 붙이는 건 과한 장치다. 무시해도 되는 시간이다.
내 환경은 그렇지 않았다.
저전력 미니 PC 한 대(애플 M4 Mini급) 위에서 온디바이스로 모델 두 개를 굴린다. 빠른 쪽은 gemma-4-e4b, 강한 쪽은 qwen3.8-27b다. 클라우드 호출이 아니라 내 장비의 메모리와 전력이 상한이다. 여기서는 30초가 무시되지 않는다.
작은 모델 하나로 끝낼 수 있으면 그게 제일 깔끔하다. 안 됐는데, 막은 것은 품질이 아니라 장비였다.
여기서 하나 배웠다. 같은 모델을 한 장비에 여러 인스턴스로 띄운다고 일이 빨리 끝나지 않는다. 병렬로 돌리면 제한된 메모리를 나눠 쓰게 되고, 그 순간 각 인스턴스는 최적 설정에서 밀려난다. 빨라지기는커녕 불안정해진다. 장비가 작을수록 한 번에 한 모델을 제대로 최적화해서 돌리고 순차로 쓰는 편이 오히려 빠르다.
그래서 방향을 바꿨다. 같은 모델을 늘리는 대신, 성격이 다른 모델 두 개를 두고 한 번에 하나씩 깨우기로 했다.
| 역할 | 모델 | 언제 |
|---|---|---|
| 상시 근무 | gemma-4-e4b (작고 빠름) |
거의 모든 턴 — 도구를 부르고 초안을 쓴다 |
| 호출 대기 | qwen3.8-27b (강하고 느림) |
설계가 필요하거나 초안이 얕을 때만 |
역할을 나누고 나니 문제가 한 칸 옮겨 갔다. 강한 모델을 언제 깨울지 누가 판단하는가.
이 판단을 gemma에게 시키면 판단에만 또 십수 초가 든다. 아끼려던 시간을 판단 비용이 먹는다. 사람에게 매번 물으면 에이전트라고 부를 수 없다. 규칙으로 박아 두면 요청의 성격을 못 읽는다.
두 LLM을 협업시키는 에이전트에서 정작 비어 있는 건 이 심판 자리였다. 그 고민을 하던 중에 마침 Jev가 나왔다(2026-09-22). 텍스트를 만들지 않고 판단만 0.3초에 돌려주는 모델 — 고민하던 빈칸과 모양이 정확히 맞았다. 신기술 구경도 할 겸 바로 붙여 봤다.
<aside> 🧪 그래서 이 글이 확인하려는 것 — 미니 장비에 올린 작은 LLM 두 대 + 분류기 하나의 하이브리드가 쓸 만한 에이전트가 되는가. 지극히 개인 환경에서의 테스트이고, 장비도 모델도 표본도 하나뿐이다. 일반화할 수 있는 벤치마크로 읽지 말 것.
</aside>