목적은 클라우드 API 없이, Mac mini에서 LM Studio가 띄운 로컬 모델을 Hermes Agent의 기본 추론 모델로 쓰는 것이다.
전체 구조
1. LM Studio에서 모델 준비
LM Studio에서 다음 모델을 받는다.
이 모델은 LM Studio Community의 GGUF 기반 모델이며, QAT는 Quantization-Aware Training을 뜻한다. Q4_0 기준으로 약 6.6~7GB 정도다.
2. LM Studio 서버 켜기
LM Studio 앱에서 Developer / Local Server를 켜도 되고, CLI가 설치되어 있다면 터미널에서 실행해도 된다.
정상 상태에서는 서버가 1234 포트에서 켜지고, 로드된 모델 목록에 Gemma 4 12B QAT가 보인다.
3. 모델 로드와 컨텍스트 길이
16GB Mac mini에서는 Gemma 4 12B QAT를 64K 이상 컨텍스트로 안정 로드하기 어렵다. 실제 테스트에서는 64K 로드 추정치가 16GB를 넘었고, LM Studio guardrail이 로드를 막았다.
그래서 데모나 짧은 작업에서는 낮은 컨텍스트로 로드한 뒤 Hermes에 연결할 수 있다.
주의할 점은 Hermes Agent가 기본적으로 64K 이상 컨텍스트를 기대한다는 것이다. 16GB 장비에서 12B QAT를 쓰려면 “짧은 작업용 로컬 Hermes”로 봐야 한다. 긴 코딩 세션, 많은 도구 호출, 브라우저 작업까지 맡기려면 64K 이상으로 실제 로드 가능한 더 작은 모델이나 메모리가 큰 장비가 낫다.
4. Hermes 설정
Hermes 설정을 LM Studio provider로 바꾼다.
16GB Mac mini에서 낮은 컨텍스트로 로드한 모델을 테스트할 때는 Hermes의 최소 컨텍스트 검사 때문에 아래 override가 필요할 수 있다.
이 값은 Hermes 시작 검사를 통과시키는 용도다. 실제 LM Studio에 로드된 컨텍스트보다 크게 잡으면 긴 대화에서 실패할 수 있다. 운영용으로는 LM Studio 모델 자체도 64K 이상으로 실제 로드되어야 한다.
5. 연결 테스트
정상이라면 LMSTUDIO_OK라고 응답한다.
6. Telegram / gateway에 반영
CLI 테스트가 성공했다면 gateway는 재시작해야 새 기본 모델 설정을 읽는다.
또는 Telegram에서 /restart를 보낸다.
문제 해결
| 증상 | 원인 | 해결 |
|---|---|---|
| Connection refused | LM Studio server가 꺼져 있음 | lms server start |
| 모델 목록에는 있는데 Hermes가 못 씀 | 모델이 로드되지 않음 | lms load 후 lms ps 확인 |
| 64K 미만 context 오류 | Hermes가 64K 이상 컨텍스트를 요구 | 모델을 64K로 실제 로드하거나 임시 override |
| 64K 로드 실패 | 16GB 장비에서 12B QAT + 긴 컨텍스트가 메모리 초과 | 더 작은 모델, 낮은 컨텍스트, 또는 메모리 큰 장비 사용 |
| 응답이 매우 느림 | M4 16GB에서 12B 로컬 추론은 느릴 수 있음 | 짧은 작업·백그라운드 에이전트 용도로 사용 |
누리 기준 권장 사용법
로컬 모델을 Hermes에 붙이는 목적은 모든 일을 로컬 모델 하나에 맡기는 것이 아니다. 저렴하고 사적인 작업은 로컬에서 처리하고, 긴 컨텍스트와 높은 정확도가 필요한 작업은 더 큰 모델이나 사람 검토로 올리는 라우팅 구조를 만드는 것이다.