인터넷 없이 내 PC 에서 도는 AI — Ollama
이 페이지 목차
먼저 알아 둘 것시작 전에1단계 · 깔려 있는지, 내 PC 가 버티는지 보기2단계 · 올라마 설치하기 (내가 직접)3단계 · 작은 모델 하나 받기4단계 · 말 걸어 보기5단계 · 인터넷을 끊고 직접 해 보기 (내가 직접)6단계 · 어디서 도는지 보기7단계 · 시험 결과를 노트로 남기기다 됐습니다 — 이제 이렇게 말하면 됩니다막히면한 번에 맡기기 (익숙해진 다음에)내가 만들 때는클로드 같은 AI 는 인터넷 너머 회사 컴퓨터에서 돌고, 쓸 때마다 한도와 요금이 따라옵니다. 올라마(Ollama) 는 AI 모델 파일을 내 PC 에 받아 놓고 내 PC 에서 돌려 주는 프로그램입니다. 한도가 없고(전기만 듭니다), 인터넷을 끊어도 되고, 글이 밖으로 나가지 않습니다. 대신 클로드만큼 똑똑하지는 않습니다. 아래 말을 순서대로 한 줄씩 치고, 2단계와 5단계는 내가 직접 합니다.
먼저 알아 둘 것
시작 전에
- 디스크 빈 공간 12GB 이상: 올라마 본체에 4GB, 모델에 약 7.2GB 가 듭니다(공식 안내).
- 빈 폴더 하나에서 클로드를 엽니다. 02편의 노트 폴더에서 해도 됩니다. 클로드가 명령을 실행하려고 허락을 물으면 무슨 명령인지 읽고 허락하세요. 처음에는 묻는 방식(Manual)이 안전합니다(02편 「준비물 자세히」).
- 🤖 칸에 「예시 답」 이라고 적힌 것은 설치·모델 실행이 들어가는 단계라 이 글을 쓰면서 실제로 돌리지 않고, 공식 문서로 답의 모양을 확인해 쓴 것입니다. 표시가 없는 답은 실제로 돌려 받은 것입니다.
준비물 자세히 (내 PC 조건 · 설치 방법 · 용어)
- Windows 조건(공식 안내): Windows 10 22H2 이상(Home 또는 Pro). NVIDIA 그래픽카드면 드라이버 551.61 이상. 설치에 관리자 권한은 필요 없고, 모델 파일은 내 계정 폴더의
.ollama에 쌓입니다. 올라마는 설치 뒤 트레이(작업 표시줄 오른쪽 아래)에서 조용히 돌고,ollama명령은 명령 프롬프트·PowerShell 어디서나 쓸 수 있습니다. - 설치 방법: ollama.com/download 에서 내 운영체제용 설치 파일(Windows 는
OllamaSetup.exe, Mac 은Ollama.dmg)을 받아 실행합니다. 같은 페이지에 터미널 한 줄 설치(Windows PowerShellirm https://ollama.com/install.ps1 | iex, Mac·Linuxcurl -fsSL https://ollama.com/install.sh | sh)도 있습니다. 인터넷에서 받은 스크립트를 바로 실행하는 방식이라, 처음에는 설치 파일을 권합니다. - 용어
- 모델: AI 의 두뇌 파일입니다. 이름 뒤
e2b·12b는 크기를 나타내는 표시이고, 클수록 똑똑하고 무겁습니다. - 로컬: 인터넷 너머가 아니라 「내 PC 안에서」라는 뜻입니다.
- 그래픽 메모리(VRAM): 그래픽카드 속 메모리입니다. 모델이 여기에 온전히 올라가야 빠릅니다.
ollama ps: 지금 메모리에 올라와 있는 모델과, 그것이 그래픽카드(GPU)와 CPU 중 어디서 도는지 보여 주는 명령입니다.
- 모델: AI 의 두뇌 파일입니다. 이름 뒤
1단계 · 깔려 있는지, 내 PC 가 버티는지 보기
클로드가 올라마가 이미 있는지, 메모리와 그래픽 메모리가 얼마인지 봅니다. 이 단계에서는 아무것도 설치되지 않습니다.
✅ 이렇게 나오면 성공 — 디스크 빈 공간이 12GB 이상이면 다음 단계로. 그래픽 메모리가 작거나 없다고 나와도 진행은 되지만 느립니다. 「막히면」 2번을 보세요.
2단계 · 올라마 설치하기 (내가 직접)
이 단계는 클로드에게 말하지 않고 내가 직접 합니다.
- ollama.com/download 에서 내 운영체제용 설치 파일을 받습니다(Windows 는
OllamaSetup.exe). - 받은 파일을 실행하고 안내를 따릅니다. Windows 는 관리자 권한이 필요 없습니다.
✅ 이렇게 나오면 성공 — 작업 표시줄 오른쪽 아래에 올라마 아이콘이 보이고, 클로드를 새로 열어 1단계의 말을 다시 쳤을 때 「올라마가 깔려 있다」고 나오면 됩니다.
3단계 · 작은 모델 하나 받기
모델은 크기가 커서 받는 데 시간이 걸립니다. 올라마를 쓰는 데 인터넷이 필요한 곳은 설치 파일(2단계)과 모델을 받는 이 단계뿐입니다. 이 편은 공식 시작 안내가 쓰는 작은 모델 gemma4:e2b 로 합니다.
✅ 이렇게 나오면 성공 — 모델 목록에 gemma4:e2b 가 보이면 다음 단계로.
4단계 · 말 걸어 보기
받은 모델에게 한 줄 물어봅니다.
✅ 이렇게 나오면 성공 — 한국어 답이 오면 됩니다. 첫 답이 느린 것은 정상입니다. 계속 안 오면 「막히면」 1번.
5단계 · 인터넷을 끊고 직접 해 보기 (내가 직접)
클로드 자체는 인터넷이 있어야 돌아서, 이 단계는 클로드 없이 터미널에서 직접 합니다.
- 터미널(PowerShell)을 엽니다.
ollama run gemma4:e2b를 입력합니다.>>>가 보이면 질문을 칠 수 있는 상태입니다.- 와이파이나 랜을 끕니다.
- 질문을 쳐 봅니다(예: 「오늘 점심 메뉴 세 개만 추천해 줘」).
- 끝낼 때는
/bye를 입력합니다. 그다음 인터넷을 다시 켭니다.
✅ 이렇게 나오면 성공 — 인터넷이 꺼진 채로 답이 나오면 「내 PC 안에서 도는 AI」가 맞습니다. (질문 내용에 따라 답의 품질은 많이 다릅니다.)
6단계 · 어디서 도는지 보기
같은 모델도 그래픽카드에 온전히 올라가면 빠르고, CPU 로 밀리면 훨씬 느립니다. 그걸 확인합니다. 4단계 직후(5분 안)에 치세요.
✅ 이렇게 나오면 성공 — PROCESSOR 칸의 값이 보이면 됩니다. 목록이 비어 있으면 4단계를 다시 한 번 하고 바로 물어보세요.
7단계 · 시험 결과를 노트로 남기기
로컬 모델은 PC 마다 속도가 다르니, 내 PC 에서 잰 값을 노트로 남겨 둡니다. 숫자는 내 PC 에서 잰 값으로 바꿔서 치세요. 클로드가 말하지 않은 풀이를 덧붙이지 않는지도 같이 봅니다.
파일을 열어 보면 내가 말한 숫자가 그대로 들어 있습니다. 다만 같은 말로 몇 번 돌려 보니 클로드가 말하지 않은 풀이를 덧붙일 때가 있었습니다. 위 답처럼 표에 「(모델 로딩 포함 추정)」을 적고 「제가 덧붙인 말이니 지워 달라」고 알려 준 적도 있고, 「모델이 GPU 에 전부 올라가 첫 응답 이후에는 빠르다」 같은 요약 줄을 말없이 붙인 적도 있고, 아무것도 덧붙이지 않은 적도 있습니다. 맞는지 훑어보고 아니면 지우라고 하세요.
✅ 이렇게 나오면 성공 — notes/local-ai-test.md 가 생기고 내가 말한 숫자가 그대로 들어 있으면 됩니다.
다 됐습니다 — 이제 이렇게 말하면 됩니다
- 「올라마에 받아 둔 모델 목록 보여 줘.」
- 「gemma4:e2b 를 메모리에서 내려 줘.」 (
ollama stop— 다시 부르면 올라옵니다.) - 「안 쓰는 모델을 지우고 싶어. 지우기 전에 이름과 크기를 먼저 말해 줘.」
- 「올라마로 더 큰 모델 gemma4:12b 를 받아도 되는지, 내 PC 사양으로 판단해 줘.」 (공식 모델 목록에서
gemma4:12b는 7.7~8.0GB 입니다.)
모델은 클수록 똑똑하고 무겁습니다. 큰 모델로 바꾸면 6단계의 PROCESSOR 칸부터 다시 보세요.
막히면
- 첫 답이 오래 걸리거나 가끔 멈춘 것 같다 → 올라마는 기본으로 5분 안 쓰면 모델을 메모리에서 내립니다(공식 FAQ). 다음에 부를 때 다시 올리느라 시간이 듭니다. 제 PC 에서는 작은 모델도 오랜만에 부르면 13초 걸린 적이 있습니다. 이렇게 말하세요: "ollama ps 로 모델이 올라와 있는지 보고, 느린 이유가 모델 로딩인지 알려 줘."
- PROCESSOR 칸이
100% CPU이거나 너무 느리다 → 그래픽 메모리에 다 못 올라간 것입니다. 같은 크기 모델이라도 그래픽카드에 온전히 올라가면 읽고, CPU 로 밀리면 느리고 못 읽는 일을 제가 겪었습니다. 이렇게 말하세요: "ollama ps 의 PROCESSOR 칸을 보여 주고, 더 작은 모델을 추천해 줘." - 긴 글을 넣었더니 앞부분만 읽고 답한 것 같다 → 올라마의 기본 문맥 길이는 4096 토큰입니다(공식 FAQ). 넘는 글은 잘리는데, 오류 없이 정상 종료처럼 보입니다. 제가 겪은 것은 12,000자 문서에서 3분의 1만 읽은 일입니다. 이렇게 말하세요: "이 글은 길어. 올라마 문맥 길이(num_ctx)를 늘려서 다시 물어 줘. 늘리면 느려지고 메모리를 더 쓰는지도 알려 줘."
- 짧은 질문인데 답이 안 오고 한참 생각만 한다 → 생각 과정을 길게 쓰는 모델이 있습니다. 제가 쓴 작은 모델 하나는 「1+1은?」에 12,192자를 생각하며 100초를 썼고, 생각을 끄니 1.8초였습니다. 이렇게 말하세요: "이 모델이 생각 모드를 끌 수 있는지 올라마 공식 문서에서 찾아 알려 줘."
- 맥에서 올라마가 두 개로 보인다 → 앱(낙타 그림)과 명령으로 띄운 서비스가 같은 번호를 다투면 한쪽이 죽습니다. 이렇게 말하세요: "올라마가 어떻게 몇 개 떠 있는지 보고, 하나만 남기는 방법을 알려 줘. 끄기 전에 먼저 말해 줘."
- 올라마로 비밀 자료를 요약시켰는데 괜찮은지 모르겠다 → 위 「먼저 알아 둘 것」을 보세요. 클로드에게 파일을 읽히면 그 내용은 클로드로 갑니다. 이렇게 말하세요: "이 파일을 네가 열지 말고, 내가 터미널에서 올라마에 직접 넘기는 명령만 알려 줘."
한 번에 맡기기 (익숙해진 다음에)
긴 프롬프트 펼치기 — 위 단계를 한 번에 시키는 말
위 1·3·4·6·7단계를 한 번에 시킵니다. 올라마 설치(2단계)와 인터넷을 끊고 해 보는 것(5단계)은 사람이 직접 해야 하니, 클로드가 거기서 멈추고 기다립니다. 빈 폴더에서 클로드를 연 뒤 붙여 넣으세요.
역할: 너는 내 PC 에서 일하는 도우미다. 올라마(Ollama, 내 PC 에서 AI 모델을 돌리는 프로그램)를 쓸 준비를 확인하고, 작은 모델 하나를 받아 한 줄을 물어보고, 어디서 도는지 보고, 결과를 노트로 남기도록 도와준다. 나는 초보자이니 어려운 말은 풀어서, 한 단계씩 말해 줘.
맥락: 올라마는 ollama.com 의 프로그램이고 설치 뒤 ollama 명령을 쓴다. 쓰는 명령은 ollama pull(받기), ollama run(말 걸기), ollama ls(목록), ollama ps(어디서 도는지), ollama stop(내리기)이다. 이 작업은 모델 gemma4:e2b(공식 안내로 약 7.2GB, 그래픽 메모리 8GB 권장)로 한다. 이름 끝에 cloud 가 붙은 모델은 올라마의 클라우드에서 돌아 로컬이 아니니 쓰지 않는다. 올라마는 5분 안 쓰면 모델을 메모리에서 내려서 다음 첫 답이 느릴 수 있다. 지금 열려 있는 이 폴더가 작업 폴더다.
입력: <운영체제>, <쓰는 클로드: Claude Code 터미널 / 데스크톱 앱의 Code 탭>, <목표: gemma4:e2b 를 받아 로컬에서 한국어 답이 오는지 확인>
작업:
① 확인 — 아무것도 설치하기 전에 올라마가 이미 있는지, 컴퓨터 메모리(RAM)·그래픽 메모리·디스크 빈 공간이 얼마인지 본다. 올라마가 없으면 멈추고 내가 ollama.com/download 에서 설치 파일을 받아 직접 설치하도록 안내한 뒤 「설치했어요」라고 할 때까지 기다린다. 디스크 빈 공간이 12GB 보다 작으면 멈추고 알린다.
② 모델 받기 — 받기 전에 모델 이름과 크기(약 7.2GB)를 말하고 내 허락을 받은 뒤 ollama pull gemma4:e2b 를 실행한다. 끝나면 ollama ls 로 목록을 보인다.
③ 말 걸기 — ollama run 으로 gemma4:e2b 에게 한국어로 「안녕, 너는 누구야?」 한 줄을 묻고, 답과 걸린 시간을 말해 준다.
④ 어디서 도는지 — ③ 직후에 ollama ps 를 실행해 PROCESSOR 칸(GPU/CPU 비율)을 알려 준다. 100% GPU 가 아니면 이유 후보(그래픽 메모리 부족 등)를 짧게 말한다.
⑤ 노트 — notes/local-ai-test.md 를 만든다: 모델 이름과 크기, ③에서 잰 시간, ④의 PROCESSOR 값, 내가 말해 주는 한국어 답 품질 한 줄. 말하지 않은 숫자는 지어 쓰지 않는다. 이미 있으면 덮어쓰지 말고 멈춰서 묻는다.
⑥ 사람이 할 일 안내 — 인터넷을 끊고 하는 시험은 네가 못 하니, 내가 직접 할 방법만 말해 준다: 터미널에서 ollama run gemma4:e2b 를 치고, 와이파이를 끄고, 질문하고, /bye 로 나오고, 인터넷을 다시 켠다.
⑦ 마무리 — 초보자 눈높이로 무엇이 됐고 앞으로 어떻게 말하면 되는지(「받아 둔 모델 목록 보여 줘」「모델을 메모리에서 내려 줘」) 설명한다.
제약: 열쇠·암호·토큰을 출력하거나 파일에 쓰지 않기. 오류를 건너뛰지 않기. 기존 파일을 지우거나 덮어쓰지 않기. 이 폴더 밖의 파일을 읽지도 쓰지도 않기. 내 허락 없이 모델을 받거나 지우거나 다른 프로그램을 설치하지 않기. 내 문서를 네가 열어서 올라마에 넣지 않기(네가 연 파일은 인터넷 너머로 가므로).
출력: 한 일, 확인된 상태(올라마 설치 여부 · 메모리·디스크 · 받은 모델과 크기), 만든 파일 목록, 시험 결과(답 · 걸린 시간 · PROCESSOR 값), 내가 해야 할 일(⑥ 그대로), 남은 문제와 다음 조치.
검증: 아래가 실제로 확인돼야 「완료」라고 보고한다. 하나라도 실패하면 완료로 보고하지 말 것.
(가) ollama ls 의 목록에 gemma4:e2b 가 있다.
(나) ollama run 으로 보낸 한 줄에 실제 한국어 답이 왔다.
(다) ollama ps 에 모델과 PROCESSOR 값이 나왔다(올라와 있지 않으면 ③을 다시 하고 바로 본다).
(라) notes/local-ai-test.md 가 있고, 내가 말하지 않은 숫자가 들어 있지 않다.
단, 인터넷을 끊고 하는 시험(⑥)은 네가 확인할 수 없으니 「완료」가 아니라 「남은 일」로 적는다.
내가 만들 때는
처음엔 이렇게 시켰습니다. 2026-08-14 11시 50분, 사내 자료를 한꺼번에 색인(자료마다 찾기 쉽게 숫자 표를 만드는 일)하던 날 이렇게 말했습니다. 「ollama 깔아줘.. 시작해봐.. 밥먹고 올동안 깔아서 사용할수 있게 해줘」 한 시간 뒤에는 걱정도 했습니다. 「ollama를 써도 너 토큰이 소비되면 어떻하자는거지?」 클로드의 답은 올라마는 토큰을 쓰지 않는다는 것이었습니다. 문서 6,734장을 색인하는 데 그래픽카드가 혼자 2.4분 돌렸고, 토큰을 쓴 것은 클로드가 옆에서 지켜본 쪽이었습니다. 올라마 이야기는 그보다 3주 전에도 나옵니다. 7월 22일에 이렇게 물었습니다. 「내가 전에 집에서 ollama로 gemma4를 로드하고 claude 를 런처시켰더니.. 데스크탑 앱에서 gemma4가 나오고 구동되더라고..」
그날 오후 1시쯤 「너 왜 ollama가 돌아가니깐 멈추지?」(멈춘 건 클로드였습니다)라고 물었더니 클로드는 5분 놀면 모델을 내려서 다시 올리느라 멈춘다고 풀었고, 모델을 계속 올려 두게 고쳤습니다. 그런데 「자꾸 멈추네」는 계속됐습니다. 진짜 원인은 올라마도 그래픽카드도 아니었습니다. 사내 저장 서버의 드라이브를 붙여 주는 프로그램이 읽은 파일을 메모리에 19GB 까지 쌓아 두어, 여유 메모리가 1GB 아래로 떨어져 있었습니다. 그 프로그램을 거치지 않고 서버 폴더를 직접 읽게 바꿔서 풀었습니다. 그래서 느릴 때는 짐작하지 말고 먼저 재 보라는 말을 「막히면」 1·2번에 넣었습니다.
비슷한 일이 두 번 더 있었습니다. 9월 11일에는 올라마에 12,000자 문서를 넣었더니 3분의 1만 읽고도 아무 오류 없이 정상 종료됐습니다. 8월 19일에는 그래픽 메모리 8GB 인 PC 에서 큰 모델(30B)이 CPU 로 밀려 초당 3.8토큰밖에 못 냈습니다. 검사 체크시트 사진으로 견줘 보니, 같은 30B 도 그래픽카드에 온전히 올라간 쪽(이때는 클라우드에서 돌린 것)은 글자를 읽었고, 제 PC 에서 CPU 로 밀린 쪽은 못 읽었습니다. 크기가 아니라 어디서 도느냐가 갈랐습니다. 9월 17일 13시 22분에는 맥에서 「올라마가 두개인데 하나는 CLI이고 하나는 낙타 그림 있는 앱인것 같애.. 어느거 끄지?」라고 물었습니다. 앱이 번호를 먼저 차지해서 명령으로 띄운 서비스가 계속 죽고 있었습니다. 8월 20일 밤에는 이렇게 말했습니다. 「비상시나.. 응급사황.. 그리고 재시작일때 지금 gemini로 해놨는데.. ollama 로컬 llm 으로 해 놓으면 훨씬 비상시 좋지 않나??」 그래서 제 개인 비서의 비상 길이 「주력 → 로컬 → Gemini」가 됐습니다. 로컬 모델은 도구를 못 쓰지만 말은 합니다. 비상 두뇌에게 필요한 건 똑똑함이 아니라 살아 있음이었습니다.