왜 로컬 AI가 다시 주목받나?
클라우드 AI가 대세인 시대에, 갑자기 로컬 AI가 뜨는 이유가 뭘까요? 가장 큰 이유는 데이터 프라이버시와 비용입니다. 민감한 데이터를 외부 서버로 보내지 않고, 내 기기에서 처리할 수 있다는 건 엄청난 장점이에요. 게다가 인터넷 연결이 불안정한 환경에서도 일관된 성능을 낼 수 있다는 점도 매력적입니다.
구글이 최근 공개한 Gemma 4 12B는 이런 로컬 AI의 가능성을 한층 끌어올렸습니다. 120억 개 파라미터 모델이지만, 일반적인 노트북에서도 구동 가능하도록 최적화되었다는 점이 핵심이에요. 이 모델은 에이전트형(Agentic) 작업, 멀티모달 입력 처리, 코드 생성 등에서 놀라운 성능을 보여줍니다.
이 글에서는 Gemma 4 12B를 실제로 노트북에서 실행하는 방법과, 구글이 함께 공개한 Google AI Edge 스택을 활용해 로컬 AI 에이전트를 구축하는 과정을 자세히 알아보겠습니다. 근거자료를 바탕으로 핵심 내용을 정리했어요.

Gemma 4 12B, 직접 돌려보자
1. Google AI Edge Gallery로 코드 생성 체험하기
가장 쉽게 체험하는 방법은 Google AI Edge Gallery 앱을 macOS에 설치하는 것입니다. 이 앱은 자연어로 분석 목표를 설명하면, 모델이 Python 코드를 생성하고 실행해서 결과를 시각화까지 해줍니다.
예를 들어, 두 개의 텍스트 파일에 2024년과 2025년 인기 여자 아기 이름 데이터가 있다고 가정해볼게요. 앱에 이렇게 요청할 수 있습니다.
"use a python program to render a chart png to compare the top 10 girl names born in 2024 vs 2025"
그러면 Gemma 4 12B는 데이터를 분석해 막대 그래프를 생성하는 Python 코드를 만들고, 직접 실행해서 PNG 파일로 저장까지 해줍니다. 코드를 몰라도 데이터 인사이트를 얻을 수 있는 셈이죠.
또한, 복잡한 3D 렌더링 작업도 가능합니다. 한 번의 프롬프트로 고무 오리 모델을 생성하고, 의존성을 자동으로 설정하며, 코드를 스스로 수정하는 과정을 거칩니다. 이는 단순 스크립트 생성 수준을 넘어서는 것이에요.
2. Google AI Edge Eloquent로 음성 받아쓰기와 텍스트 편집을 로컬에서
Eloquent는 AI 기반 받아쓰기 및 텍스트 편집 앱입니다. macOS 데스크톱 버전은 모든 기능이 100% 온디바이스에서 동작하며, 완전한 오프라인 경험을 제공합니다. 커스터마이즈 가능한 단축키를 사용해 맥의 어떤 앱에서든 음성 받아쓰기를 사용할 수 있어요. 오디오나 비디오 파일의 로컬 전사(Transcription)도 지원합니다.
Gemma 4 12B의 고급 추론 능력을 활용한 Voice Edit 기능도 주목할 만합니다. 특정 텍스트를 선택하고 "이 노트를 경영진 요약으로 재구성해줘" 또는 "이걸 힌디어로 번역해줘" 같은 음성 명령을 내리면 됩니다. 이전 모델 대비 명령 수행 능력이 크게 향상되었고, 품질도 60% 이상 개선되었다고 해요.
3. LiteRT-LM CLI로 나만의 로컬 LLM 서버 만들기
더 나아가, LiteRT-LM CLI를 사용하면 코드 작성 없이도 로컬 LLM 서버를 구동할 수 있습니다. serve 명령어가 추가되어, OpenAI 호환 API 서버로 동작합니다. 이 기능을 활용하면 기존에 사용하던 도구나 프레임워크(예: OpenClaw, Hermes, OpenCode, Continue, Aider)를 로컬 엔드포인트에 연결할 수 있어요.
# Gemma 4 12B 모델을 'gemma4-12b'로 임포트
litert-lm import --from-huggingface-repo=litert-community/gemma-4-12B-it-litert-lm gemma-4-12B-it.litertlm gemma4-12b
# OpenAI 호환 서버 시작
litert-lm serve
# API 호출 테스트
curl http://localhost:9379/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4-12b,gpu",
"messages": [{"role": "user", "content": "Hello!"}]
}'
이렇게 하면 별도의 GPU 서버 없이도 노트북에서 LLM 서버를 운영할 수 있습니다. 물론 성능은 하드웨어 사양에 따라 달라지겠지만, 모델 카드에 따르면 일상적인 노트북에서도 충분히 사용 가능한 수준입니다.
4. 실제 코드 예제: 데이터 시각화 자동화
Gallery 앱에서 사용된 것과 유사한 코드를 직접 작성해볼까요? 아래는 Python으로 CSV 데이터를 읽어 막대 그래프를 생성하는 예시입니다.
import pandas as pd
import matplotlib.pyplot as plt
# 데이터 파일 경로
data_2024 = 'girl_names_2024.csv'
data_2025 = 'girl_names_2025.csv'
def load_top_names(file_path, year):
df = pd.read_csv(file_path)
return df.head(10).set_index('name')['count'].rename(f'{year}')
# 상위 10개 이름 로드
top_2024 = load_top_names(data_2024, 2024)
top_2025 = load_top_names(data_2025, 2025)
# 그래프 생성
fig, ax = plt.subplots(figsize=(10, 6))
top_2024.plot(kind='bar', ax=ax, alpha=0.7, label='2024')
top_2025.plot(kind='bar', ax=ax, alpha=0.7, label='2025', color='orange')
ax.set_title('Top 10 Girl Names: 2024 vs 2025')
ax.set_xlabel('Name')
ax.set_ylabel('Count')
ax.legend()
plt.tight_layout()
plt.savefig('comparison.png')
plt.show()
이 코드는 데이터 분석가가 아니더라도 자연어 프롬프트로 대체할 수 있는 작업입니다. Gemma 4 12B는 이런 코드를 스스로 생성하고 실행할 수 있기 때문에, 생산성이 크게 향상됩니다.

로컬 AI 도입 시 주의사항과 한계
1. 하드웨어 제약
Gemma 4 12B는 12B 파라미터 모델이므로, 메모리와 GPU 성능이 중요합니다. 모델 카드에 따르면 최소 16GB RAM을 권장하며, GPU가 없다면 CPU만으로는 속도가 느릴 수 있습니다. 특히 복잡한 추론 작업은 실사용이 어려울 정도로 느려질 수 있어요. 노트북 사양을 미리 확인하고, 필요하다면 GPU 가속을 지원하는 환경을 고려해야 합니다.
2. 모델의 한계
12B 모델은 대형 모델(예: 70B 이상)에 비해 추론 능력이 제한적입니다. 복잡한 논리적 추론이나 전문 지식이 필요한 작업에서는 오류가 발생할 가능성이 높습니다. 또한, 환각(Hallucination) 현상이 완전히 제거된 것은 아니므로, 중요한 결정을 내릴 때는 출력을 검증하는 습관이 필요합니다.
3. 보안 및 개인정보
로컬 실행이 데이터 프라이버시를 보장하지만, 모델 자체가 사용자의 데이터를 학습하지 않도록 설계되었는지 확인해야 합니다. 또한, 로컬 서버를 외부에 노출할 경우 보안 위험이 있으므로 주의가 필요합니다. 기본적으로 localhost에서만 실행하고, 방화벽 설정을 철저히 하는 것이 좋습니다.
4. 생태계 성숙도
아직 로컬 AI 에이전트 도구는 초기 단계입니다. 다양한 도구와의 통합이 완벽하지 않을 수 있고, 커뮤니티 지원도 제한적일 수 있습니다. 특히 한국어 지원이 완벽하지 않을 수 있으므로, 영어 중심의 워크플로우에 익숙한 개발자에게 유리합니다.

한국 개발 생태계에서의 적용과 다음 단계
국내에서는 클라우드 AI 서비스에 대한 의존도가 높은 편인데, 비용 절감과 데이터 보안 측면에서 로컬 AI가 좋은 대안이 될 수 있습니다. 특히 금융, 의료 등 민감한 데이터를 다루는 기업에서 온프레미스 AI 도입을 고려한다면, Gemma 4 12B와 같은 오픈 모델이 매력적입니다.
또한, 스타트업이나 개인 개발자라면 클라우드 API 비용을 줄이기 위해 로컬 LLM 서버를 활용할 수 있습니다. LiteRT-LM CLI를 사용하면 기존 애플리케이션을 크게 바꾸지 않고도 로컬 추론으로 전환할 수 있어요.
다음 단계로는 **파인튜닝(Fine-tuning)**을 시도해보는 것을 추천합니다. 특정 도메인 데이터로 모델을 튜닝하면 더 높은 성능을 낼 수 있습니다. 또한, 메타의 자율 AI 에이전트 REA처럼 에이전트를 자동화하는 방법을 연구하는 것도 좋은 방향입니다. 그리고 Vercel CDN 대시보드처럼 인프라 관리 트렌드도 함께 살펴보면 도움이 될 거예요.
마지막으로, 로컬 AI는 아직 발전 중인 분야입니다. 공식 문서와 커뮤니티의 최신 정보를 지속적으로 확인하면서, 자신의 워크플로우에 맞게 적용해보는 것이 중요합니다. 지금 바로 노트북에서 Gemma 4 12B를 실행해보세요. 생각보다 훨씬 강력한 경험을 할 수 있을 거예요.