앞서 DS4.c 에 대해 간단히 글을 작성 했는데요, 대략 거의 코딩을 위한 로컬LLM은 Claude Code + DS4.c(Deepseek-v4-flash) 만으로 2주를 보낸 것 같습니다.
DS4.c 를 사용하기 시작한 초반 이틀 정도는 Qwen3.6 27B 나 35b-a3b 도 같이 사용을 했었습니다만. 현재는 Vision 이 필요한 작업이 아닌 이상 에이전트를 통한 LocalLLM은 DS4.c 단일로 사용중입니다.
MoE 아키텍쳐라 해도 284B 파라미터이 13B 활성화 이기 때문에 높은 속도를 기대하기는 어려운 모델이긴 합니다.
보통 Prefill 시에는 평균 2~300tps 정도 디코딩은 평균 22~24tps 정도로 동작합니다. 당연히 애플 맥 스튜디오 M3 Ultra 512gb 기준이구요. DS4.c 의 README 에서 제시하는 TPS 와 비슷한 수준이 나오긴 합니다.
물론 전 q4-imatrix 양자화 모델을 사용중이고 ctx 옵션을 1000000을 주어서 사용중이기 때문에 README상이 벤치마크 수치보다는 조금 떨어지는 속도긴 합니다만.
Qwen 3.6 35b a3b 의 경우 6~70tps 가 나오고 Minimax m2.7의 경우도 50tps 는 나오기 때문에 기존에 제가 주로 사용하던 모델들 대비 2~3배가 느립니다
하지만!
지금까지 제가 개발을 위해 로컬에서 사용해온 LLM 모델, 추론엔진(Ollama, LM Studio, mlx-ml, llama.cpp)들을 통 틀어서 이게 최고입니다.
병렬지원이 안되고 다소 느린 속도임에도 최고라 평하는 이유는 툴 호출이나 진행 과정에서 2주간 24시간 내내 돌리고 있음에도 단 한번도 오류가 난 적이 없습니다.
저는 보통 업무시간 중에는 계속 테스트를 병행해야하고 기타 리서치나 라이브러리 검증 같은 짓을 하며서 클로드맥스와 코덱스와 병행해서 사용을 하는 편이고 업무시간 이후에는 도커 컨테이너 위에 bypass mode 로 ralph loop 플러그인으로 무한정 돌립니다.
LM Studio 도 llama.cpp 도 qwen2.5, qwen3, qwen3-coder, qwen3.5, minimax, gemma4, nividia nemotron, glm-4.7-flash. glm-5.1 등 수 많은 추론엔진과 다양한 양자화 모델들을 사용해 왔습니다만 .. 복잡한 프로젝트를 24시간이상 장시간 무한 반복해서 에이전트를 갈굴경우에 .. 툴 호출과정에서의 오류나 compact context 이후에 컨텍스트 내용상의 특정 내용에 의한 오류로 진행이 멈춰버리고 /clear 하기 전에는 더이상 진행하지 못하는 상태에 빠지는 경우가 100% 였습니다.
이런 문제가 없는 모델, 추론엔진 한번도 만나보지 못했고.. 물론 시간이 지나면서 jinja 템플릿이나 이런저런 설정, 버그가 수정된 다른 형태의 양자화 모델들등 .. 지속적으로 무언가 업데이트가 올라오지만 그러한 정보를 늘상 찾아 당겨야 한다는게 너무 큰 부담이라 할까요?
근데 ds4.c 이놈은 .. 그게 없습니다.
애초에 Deepseek-v4-flash 단일 모델을 위한 추론엔진 인데다 .. 복잡한 설정값 같은 것들도 따로 크게 신경쓸 필요 없이 그냥 쓰면 됩니다.
애초에 만들어 배포하는 사람이 유명 개발자(Redis 만든사람)이고 만든 사람 자체도 에이전트를 붙여서 개발에 쓰기 위해서 만들었고 계속 그 목적으로 테스트하고 업데이트해가고 있는 만큼.. 자잘하게 신경쓸거 없이 git clone -> make 면 끝입니다. 업데이트도 그냥 git pull -> make clean -> make …
맥 스튜디오로 LocalLLM 을 반년 운용하고 있는 상황에서 단 한번의 이상현상 없이 계속 동작해준 추론엔진은 이게 유일했네요. 물론 모델의 파라미터에 따라 복잡한 작업에서 긴 삽질을 하거나 삼천포로 빠지거나 하는건 오류라기 보다 지능의 특성정도로 봐줄수 있구요. 이런경우는 지시사항을 조금 손봐서 다시 돌리면 꽤 잘 마무리를 합니다.
2주간 8개 정도 크고 작은 프로젝트를 이놈을 통해서 완성 했습니다만 낮은 tps 에 따라서 다소 많은 시간이 소요되는 점을 제외하곤 그냥 돌려 놓고 자면 그만이니 ..
몇일 전에 Qwen 3.6에 MTP 가 업데이트된 것 보니 대충 속도가 1.5~2배 정도 빨라진 느낌인데 DS4.c 의 MTP 도 언젠가 제대로 적용되서 3~40tps 정도 수준의 속도만 나와 준다면 정말 이거 하나에 정착할 것 같습니다.
한가지 단점은 현재로썬 최소한 96GB 이상의 VRAM 또는 통합 메모리가 있어야 써볼 수 있다는 점 정도?
최상의 결과를 얻으려면 128GB 이상은 있어줘야 하고 제 경우와 같이 1M 컨텍스트를 맘놓고 쓰려 한다면 256GB 는 있어줘야 한다 정도..
사양이 허용하는 경우 한번쯤 사용해 보시기 바랍니다. 강력 추천 합니다.