로컬 LLM 한계
M4 Pro 기본형 기준.
gemma4:e2b
매우 빠르게 처리함. (번역 및 일반적인 질의에 RAG 컨텍스트 주입 시 기대를 낮추고 사용 가능한 정도)
코딩 불가능, Tool Calling 불가능
gemma4:12B 및 qwen3.5:9b
느림… (번역 시 번역가 수준으로 매우 훌륭함. RAG 컨텍스트 주입 시 적당히 사용 가능)
코딩 불가능, Tool Calling은 불안정하고 미흡하지만 사용 가능.
그 외 최근에 나오는 Muse Glimmer, Nemotron 3.5 Lightning, Qwen 3.8 27B 등은 상당한 수준의 성능(속도가 아님)을 보여줄 것으로 기대되나, 기본적으로 18GB~23GB 정도의 메모리를 필요로 하므로 최소 32GB 정도의 맥북 통합 메모리 구조에서나 구동 가능함.
아직은 로컬 LLM을 사용하기에 성능적 한계가 있으나, 짧으면 3년, 늦어도 M10 정도가 나오면 충분히 로컬 LLM 시대가 개막될 듯. (가격적인 측면과 성능적인 면에서 접근해 볼 수 있는 수준)
재미있는 기능들을 해볼 게 많은데 아직은 기다려야 할 듯.
