로컬로 AI 구동하기 — 그리고 '로컬'이 신화가 되는 지점
오늘 터미널에 ollama를 입력해 보라. 시작되는 건 로컬 모델이 아니다.
2026년 7월 11일 출시된 버전 0.32.0부터, 이 단순한 명령어는 에이전트를 하나 연다 — 그리고 Ollama의 릴리스 노트에는 그게 무엇인지 이렇게 적혀 있다. “Chat, Code, & Work (glm-5.2:cloud)”. 클라우드 모델이다. 로컬 AI의 대표 도구가 기본 실행에서 당신을 온라인으로 보낸다.
이건 스캔들이 아니라 제품 설계 결정이고, 끌 수도 있다. 하지만 이 글을 여는 데는 완벽한 사례다. 이제 “로컬”이라는 단어는 믿을 게 아니라 확인해야 할 대상이 됐기 때문이다.
애초에 이걸 하는 이유
정말로 근거가 되는 것부터 시작하자 — 그건 돈이 아니다.
자기 서버에서, 순전히 자기 목적으로만 AI를 운영한다면, 독일 데이터보호협의체(Datenschutzkonferenz)의 견해에 따르면 위탁 처리 관계 자체가 사라진다. 당신이 유일한 책임자가 된다. GDPR 제28조 3항에 따른 위탁 처리 계약도, 하위 수탁자 체인도, 제3국 이전도, 내년에 무너질 수도 있는 적정성 결정도 필요 없다.
이해해야 할 핵심은 이거다. 로컬 처리는 위험을 줄이는 게 아니다. 그것은 의무 사슬 전체가 구조적으로 사라지는 것이다. 감독 당국은 특히 추가 학습과 파인튜닝에 대해 로컬 처리를 명시적으로 권장한다.
그리고 자기 AI를 돌리면 규제 의무를 집안에 끌어들이는 게 아니냐는 흔한 걱정은 개인 사용자와는 무관하다. AI Act 제2조 10항에 따라 순수 개인적·비직업적 사용에는 애초에 적용되지 않고, 제2조 12항은 무료 오픈소스 시스템을 일반적으로 예외로 둔다.
(이것은 2026년 7월 24일 기준 당국의 지침과 법 조문을 그대로 옮긴 것이며 — 법률 자문이 아니다. 실제 사업적 사례라면 데이터보호 책임자에게 물어야 할 문제다.)
그래픽카드에 뭐가 들어가는가
공식적으로 가장 정직한 VRAM 정보는 Ollama 라이브러리의 파일 크기다. 대략 계산하면 파일 크기만큼의 비디오 메모리에, 약간의 여유가 필요하다.
| 모델 | 크기 (Q4) | 탑재 가능 |
|---|---|---|
| Gemma 4, 12B | 7.6 GB | 8 GB 카드, 빠듯하게 |
| gpt-oss-20b | 16 GB용 설계 | 16 GB 카드 |
| Qwen3.6-27B | 17 GB | 24 GB 카드 |
| Gemma 4, 31B | 20 GB | 24 GB 카드 |
| Laguna XS 2.1 (q4) | 20 GB | 24 GB 카드 |
| Qwen3.6-35B | 24 GB | 24 GB, 아주 빠듯하게 |
그래서 현실적인 입문 기준은 16 GB 카드다. 독일의 한 대형 유통업체에서 16 GB RTX 5060 Ti는 555.85유로(프로모션 가격), 가장 저렴한 정규 16 GB 카드는 559.64유로였다. 32 GB 카드(RTX 5090)는 4,248.99유로로 그 몇 배에 달한다.
여기서 자주 잘못 설명되는 두 가지가 있다.
양자화는 모델을 작게 만들 뿐 아니라 더 빠르게도 만든다. 표준 예시인 Llama-3.1-8B에서 4비트 버전은 초당 71.93토큰을 생성하는 반면, 16비트 버전은 29.17토큰에 그친다 — 2.5배 차이다. 이유는 텍스트 생성이 메모리 대역폭에 의해 제한되기 때문이다. 비트가 적으면 읽어야 할 양도 적다. 양자화가 공간이 부족해서만 감수하는 순수한 품질 타협이라는 통념은 사실이 아니다.
전기료는 상관없다. 하루 한 시간 풀로드 기준, 5060 Ti는 월 약 2.22유로, 5090은 약 7.09유로가 든다 — 독일 공식 가정용 전기 요금인 kWh당 40.55센트로 계산한 값이다. 하루 네 시간이라 해도 각각 8.88유로, 28.35유로다. “로컬 AI는 전기료 때문에 손해”라는 주장은 이걸로 끝이다. 결정은 오직 구매가에서 갈린다.
거의 아무도 써놓지 않는 계산
그리고 구매가는 당신에게 불리하게 결정된다.
555.85유로는 — 조회일 환율 기준으로 — Gemini 3.5 Flash-Lite에서 약 2억 5,300만 출력 토큰에 해당한다. Claude Haiku 4.5에서는 1억 2,600만, Claude Sonnet 5에서는 여전히 6,300만, GPT-5.6 Sol에서는 그래도 2,100만이다.
이게 무슨 뜻인지 곱씹어 보라. 하루 5,000토큰을 생성하는 사람 — 이미 매우 집중적인 일일 사용량이다 — 이 2억 5,300만 토큰을 다 쓰려면 계산상 약 138년이 걸린다.
손익분기점으로 표현하면: 월 10유로의 API 지출 기준으로 입문용 카드는 약 71개월, 즉 6년 만에 본전을 뽑는다. 월 25유로라면 2년 남짓. 월 50유로가 돼서야 12개월이 채 안 되는 시점에서 흥미로워진다. 5090은 월 50유로 기준으로 약 8년이 걸린다.
로컬 AI는 재정적으로는 거의 항상 더 저렴한 선택이 아니다. “장기적으로 돈이 절약된다”는 근거로 이를 정당화하는 사람은 대개 계산을 잘못한 것이다. 이걸 사는 이유는 데이터 주권 때문이다 — 이것도 진짜 가치이긴 하지만, 다른 종류의 가치다.
정직한 예외 하나: 컴플라이언스상 어차피 유럽 내 데이터 상주가 필요한 경우, 미국의 두 대형 사업자 모두 정확히 10%의 추가 요금을 부과한다 — OpenAI는 이를 “a 10% uplift”라 부르고, Anthropic은 1.1배 계수로 표현한다. 이는 계산을 약간 바꾸지만, 극적으로 바꾸지는 않는다.
성능 격차 — 그리고 숫자 안에 숨은 함정
여기서 많은 것이 뒤섞이는데, 그 구별이 결정적이다.
“오픈 모델이 거의 따라잡았다”는 말은 맞다 — Artificial Analysis의 Intelligence Index에서 Kimi K2.6과 MiMo V2.5 Pro는 54점, DeepSeek V4 Pro는 52점인 반면, 1위인 GPT-5.5는 60점이다. 1년 전에는 격차가 훨씬 컸다.
“이건 집에서 돌릴 수 있다”는 건 다른 모델에 대한 다른 이야기다. Kimi K2.6은 파라미터가 1조 개다. DeepSeek V4 Pro는 1.6조 개. 이것들은 데이터센터급 모델이다. 오픈소스이긴 하지만, 그렇다고 당신의 그래픽카드에서 돌아간다는 뜻은 아니다.
실제로 한 장의 카드에 들어가는 모델은 그보다 훨씬 뒤처져 있다. Qwen3.6-27B는 37점을 받는다 — 자기 크기 등급에서 1위이긴 하지만, 어쨌든 60점 대 37점이다. gpt-oss-20b는 15점이다.
그리고 블라인드 비교에서의 검증은 더 확실하다. LMArena 순위표 상위 15위 안에 오픈 모델은 단 하나도 없다. 가장 뛰어난 오픈 모델이 29위다.
공정하게 말하자면: 이 아레나의 방법론은 이미 문서화된 비판을 받은 바 있다(“The Leaderboard Illusion”). 데이터의 상당 부분이 소수의 상업적 사업자로부터 나온다는 게 그 이유 중 하나다. 다만 그 비판은 스스로 특정 모델 사업자와 가까운 저자들에게서 나온 것이다. 둘 다 함께 놓고 봐야 한다.
내 결론은 이렇다. 요약, 재구성, 구조화, 간단한 코딩이라면 24 GB 카드 위의 27B 모델로 충분하다. 어려운 케이스들 — 긴 사고, 중첩된 과제, 에이전트형 작업 — 에서는 그 23점 차이를 즉시 체감하게 된다.
‘로컬’이 로컬이 아닌 지점
이건 어느 가이드도 쓰지 않는 부분이다. 불편하기 때문이다.
Ollama의 기본 실행. 위에서 본 대로다. v0.32.0부터 ollama는 클라우드 모델로 에이전트를 시작한다. 클라우드 모델은 로컬 모델과 같은 라이브러리 목록에 있고, 태그의 접미사로만 구분된다 — gemma4:31b는 당신의 기기에서 돌지만 gemma4:31b-cloud는 그렇지 않다. 글자 하나 차이다.
에이전트의 웹 검색은 Ollama 자체 서버를 거치며, 계정과 API 키를 요구한다.
순수 로컬 사용에서도 메타데이터는 발생한다. Ollama의 개인정보 처리방침은 이를 명확히 구분한다 — 콘텐츠는 로컬에서 수집되지 않는다고 명시적으로 밝힌다. “We do not collect, store, transmit, or have access to your prompts, responses, model interactions, or other content you process locally.” 하지만 기기·사용 메타데이터는 그렇지 않다.
LM Studio는 텔레메트리가 없다고 밝히면서, 동시에 인터넷이 필요한 다섯 가지 기능을 공개적으로 명시한다. 모델 검색, 모델 다운로드, 카탈로그 통계, 런타임 다운로드, 업데이트 확인. 이것이 모범적인 방식이다 — 경계선이 문서에 그대로 나와 있다.
그리고 가장 유명한 모델 중 하나에서, 주권을 향한 첫걸음은 신원 제출이다. “오픈”이라는 Llama 4 가중치를 다운로드하려면 Meta는 전체 법적 이름과 생년월일을 요구한다. 애초에 Llama 라이선스는 오픈소스 라이선스가 아니다 — 월간 활성 사용자 7억 명을 넘으면 Meta에 허가를 구해야 하고, 그 허가는 Meta의 재량으로 부여된다.
라이선스가 중요하다면 어떤 모델을 고를지
“오픈”이 진짜 오픈을 의미해야 한다면, 라이선스가 첫 번째 기준이다 — 그리고 여기서 거의 모든 오래된 가이드가 여전히 잘못 알고 있는 무언가가 바뀌었다.
Gemma 4는 2026년 3월 31일 출시 이후 Apache 2.0을 따른다 — 라이선스 페이지에는 온전한 원문 그대로가 실려 있다. 이전의 모든 Gemma 세대는 제한적인 자체 라이선스를 갖고 있었고, Google은 원격으로 사용을 제한할 권리까지 유보했었다. Gemma 3 이하 버전에는 여전히 이 라이선스가 적용된다. “Gemma는 자체 라이선스를 갖고 있다”고 말하는 가이드를 읽고 있다면, 그건 낡은 가이드를 읽고 있는 것이다.
Qwen3.6-27B는 추가 조항 없는 원본 그대로의 Apache 2.0을 따르며, 동시에 자기 크기 등급에서 가장 강력한 모델이다. 24 GB 카드용으로 하나만 추천해야 한다면 이걸 고르겠다.
gpt-oss-20b 역시 Apache 2.0을 따르며, 모델 카드에 따르면 명시적으로 16 GB용으로 설계되었다 — 입문용 카드에서 가장 편안한 시작점이다.
이걸로 잃는 것
광고가 되지 않도록, 여기 정직한 대가를 적는다.
속도. 입문용 카드는 데이터센터가 아니다. 긴 컨텍스트와 긴 사고에서는 기다려야 한다.
성능. 37점 대 60점은 반올림 오차가 아니다. 어려운 과제에서는 당신의 로컬 모델이 더 못한다.
유지보수. 드라이버, 양자화, 모델 업데이트, 망가지는 의존성들. API를 쓰면 아무도 청구하지 않는 작업이다. 다른 누군가가 대신 해주고 있기 때문이다.
그리고 내가 메우지 못한 공백 하나. Ollama와 LM Studio 양쪽 공식 문서 어디에서도, 다운로드한 모델 가중치가 출처를 암호학적으로 검증받는지에 대한 진술을 찾지 못했다. 자기 기기에서 실행하는 파일이라면, 그건 있었으면 하는 정보였다.
내 결론
돈을 아끼려고 그래픽카드를 사지는 마라. 그 계산은 거의 항상 맞지 않고, 반대로 계산해서 보여주는 사람이 있다면 당신의 사용량이나 카드 가격 중 하나를 미화한 것이다.
특정 텍스트가 당신의 집을 벗어나지 않는다는 게 중요하다면 사라 — 의뢰인 데이터, 환자 데이터, 원고, 계약서 등, “이게 지금 어디 있는가”라는 질문에 진짜 답이 필요한 모든 것 말이다. 그런 경우 로컬 AI는 더 저렴한 해법이 아니라, 유일하게 깨끗한 해법이다. 체인 안에 제3자가 더 이상 존재하지 않기 때문이다.
그리고 시작한다면 작게 시작하라. 16 GB 카드, gpt-oss-20b 또는 중간 크기의 Gemma 4로 일주일 동안 실제로 무엇을 쓰는지 솔직하게 지켜봐라. 그 후에야 24 GB 카드가 그럴 가치가 있는지 알게 된다 — 미리 추측하는 것보다 낫다.
주변 도구들은 내가 계속 관리하는 137개 AI 도구 인덱스에, 어떤 상업용 모델이 무엇에 적합한지는 ChatGPT·Claude·Gemini 비교에 있다.
출처
모두 2026년 7월 24일 확인. 가격, 모델 상태, 라이선스는 바뀔 수 있으며, 하드웨어 가격은 조회일 기준 유통업체 가격이다.
- Qwen3.6 · Gemma 4 · gpt-oss-20b — 모델 카드 및 라이선스 원문
- Llama 라이선스 및 다운로드 조건 — Meta
- 모델 라이브러리(양자화별 파일 크기) · 릴리스 노트 v0.32.0 · 개인정보 처리방침 — Ollama
- 문서(오프라인 운영, 텔레메트리) — LM Studio
- 양자화 비교 — llama.cpp
- GeForce RTX 50 사양 — NVIDIA
- 가정용 전기 요금 — 독일 연방통계청 (40.55 ct/kWh, 2025년 하반기)
- Intelligence Index — Artificial Analysis · Leaderboard — LMArena
- 인공지능과 데이터 보호에 관한 지침 — 독일 데이터보호협의체(DSK)
- AI Act: 규정 (EU) 2024/1689, 제2조 10항 및 12항
- API 가격: OpenAI · Google · Anthropic
여기서 뭔가 오래되거나 잘못된 것 같다면: 연락해 달라.
댓글
댓글, 좋아요, 저장을 하려면 로그인하세요. 로그인 →
아직 댓글이 없어요. 첫 댓글을 남겨보세요.