공개본 기준: 이 서재에는 공개 가능한 방법론과 요약만 표시합니다. 원본 자료·내부 경로·검증 로그·고객/기관 식별 정보는 권한자용 저장소에서만 확인합니다.
가이드

LM Studio Gemma 4 12B QAT를 Hermes Agent에 연결하는 법

Mac mini에서 LM Studio가 띄운 Gemma 4 12B QAT 로컬 모델을 Hermes Agent의 기본 추론 모델로 연결하고 검증하는 절차.

목적은 클라우드 API 없이, Mac mini에서 LM Studio가 띄운 로컬 모델을 Hermes Agent의 기본 추론 모델로 쓰는 것이다.

전체 구조

LM Studio 모델 다운로드 → Gemma 4 12B QAT 로드 → LM Studio Local Server 시작 → Hermes provider를 lmstudio로 변경 → Hermes CLI로 응답 테스트 → 필요하면 gateway 재시작

1. LM Studio에서 모델 준비

LM Studio에서 다음 모델을 받는다.

google/gemma-4-12b-qat

이 모델은 LM Studio Community의 GGUF 기반 모델이며, QAT는 Quantization-Aware Training을 뜻한다. Q4_0 기준으로 약 6.6~7GB 정도다.

2. LM Studio 서버 켜기

LM Studio 앱에서 Developer / Local Server를 켜도 되고, CLI가 설치되어 있다면 터미널에서 실행해도 된다.

lms server start lms status lms ls

정상 상태에서는 서버가 1234 포트에서 켜지고, 로드된 모델 목록에 Gemma 4 12B QAT가 보인다.

http://127.0.0.1:1234/v1

3. 모델 로드와 컨텍스트 길이

16GB Mac mini에서는 Gemma 4 12B QAT를 64K 이상 컨텍스트로 안정 로드하기 어렵다. 실제 테스트에서는 64K 로드 추정치가 16GB를 넘었고, LM Studio guardrail이 로드를 막았다.

그래서 데모나 짧은 작업에서는 낮은 컨텍스트로 로드한 뒤 Hermes에 연결할 수 있다.

lms load google/gemma-4-12b-qat --context-length 38207 --parallel 1 --gpu max -y lms ps

주의할 점은 Hermes Agent가 기본적으로 64K 이상 컨텍스트를 기대한다는 것이다. 16GB 장비에서 12B QAT를 쓰려면 “짧은 작업용 로컬 Hermes”로 봐야 한다. 긴 코딩 세션, 많은 도구 호출, 브라우저 작업까지 맡기려면 64K 이상으로 실제 로드 가능한 더 작은 모델이나 메모리가 큰 장비가 낫다.

4. Hermes 설정

Hermes 설정을 LM Studio provider로 바꾼다.

hermes config set model.provider lmstudio hermes config set model.default google/gemma-4-12b-qat hermes config set model.base_url http://127.0.0.1:1234/v1 hermes config set model.api_key lm-studio

16GB Mac mini에서 낮은 컨텍스트로 로드한 모델을 테스트할 때는 Hermes의 최소 컨텍스트 검사 때문에 아래 override가 필요할 수 있다.

hermes config set model.context_length 64000

이 값은 Hermes 시작 검사를 통과시키는 용도다. 실제 LM Studio에 로드된 컨텍스트보다 크게 잡으면 긴 대화에서 실패할 수 있다. 운영용으로는 LM Studio 모델 자체도 64K 이상으로 실제 로드되어야 한다.

5. 연결 테스트

hermes chat -q "Respond with exactly: LMSTUDIO_OK" -Q

정상이라면 LMSTUDIO_OK라고 응답한다.

6. Telegram / gateway에 반영

CLI 테스트가 성공했다면 gateway는 재시작해야 새 기본 모델 설정을 읽는다.

hermes gateway restart

또는 Telegram에서 /restart를 보낸다.

문제 해결

증상원인해결
Connection refusedLM Studio server가 꺼져 있음lms server start
모델 목록에는 있는데 Hermes가 못 씀모델이 로드되지 않음lms loadlms ps 확인
64K 미만 context 오류Hermes가 64K 이상 컨텍스트를 요구모델을 64K로 실제 로드하거나 임시 override
64K 로드 실패16GB 장비에서 12B QAT + 긴 컨텍스트가 메모리 초과더 작은 모델, 낮은 컨텍스트, 또는 메모리 큰 장비 사용
응답이 매우 느림M4 16GB에서 12B 로컬 추론은 느릴 수 있음짧은 작업·백그라운드 에이전트 용도로 사용

누리 기준 권장 사용법

가벼운 로컬 질의 / 짧은 에이전트 테스트 → Gemma 4 12B QAT 긴 코딩 세션 / 도구 많이 쓰는 작업 → 클라우드 고성능 모델 또는 더 작은 로컬 모델 반복 자동화 / 24시간 보조직원 → 작업 범위를 좁히고 cron·script·local LLM로 분리

로컬 모델을 Hermes에 붙이는 목적은 모든 일을 로컬 모델 하나에 맡기는 것이 아니다. 저렴하고 사적인 작업은 로컬에서 처리하고, 긴 컨텍스트와 높은 정확도가 필요한 작업은 더 큰 모델이나 사람 검토로 올리는 라우팅 구조를 만드는 것이다.