คู่มือติดตั้ง Ollama AI
แบบครบขั้นตอน
รัน LLM แบบ Local บนเครื่องคุณเอง ด้วย Ollama — ไม่ต้องพึ่ง Cloud, ไม่ต้องจ่ายเงินรายเดือน รองรับ Llama, Mistral, Gemma และอีกมากมาย
ภาพรวม Ollama AI บน Ubuntu Server 24.04
Ollama คือระบบรัน LLM (เช่น Llama, Mistral, Gemma) แบบ Local บนเครื่องคุณ โดยไม่ต้องใช้ Cloud ทำงานได้ทันทีหลังติดตั้ง มี API พร้อมใช้งาน
รัน AI แบบ Offline
ไม่ต้องเชื่อมอินเทอร์เน็ตหลังดาวน์โหลด Model
API พร้อมใช้งาน
localhost:11434 รองรับ REST API เต็มรูปแบบ
รองรับ CPU / GPU
สลับไปใช้ GPU อัตโนมัติเมื่อตรวจพบ
ใช้ RAM เป็นหลัก
จำนวน RAM กำหนดขนาด Model ที่รันได้
ความต้องการระบบ (RAM Based Recommendation)
RAM เป็นตัวกำหนดความสามารถหลัก — สำคัญกว่า CPU อย่างมาก 8B model ใช้ RAM ประมาณ 6–10GB, 13B model ใช้ RAM ประมาณ 12–20GB
| RAM | ประเภทเครื่อง | Model แนะนำ | ความเร็ว | การใช้งาน |
|---|---|---|---|---|
| 8 GB | Mini Server / VPS เล็ก | llama3.2:1b / tiny models | ช้า | ทดลอง / Dev |
| 12 GB | Home Server | mistral 7B Q4 | ปานกลาง | Chat bot ส่วนตัว |
| 16 GB | Standard Server | llama3.1 8B | ดี | ใช้งานจริง |
| 24 GB | Advanced Server | mixtral 8x7B (quantized) | เร็ว | AI Assistant |
| 32 GB | High Performance | llama3.1 8B + 13B models | เร็วมาก | Production / Multi model |
หมายเหตุสำคัญ: RAM = ตัวกำหนดความสามารถหลัก (สำคัญกว่า CPU) ถ้า RAM ไม่พอ Model จะรันไม่ได้ หรือระบบจะใช้ Swap ทำให้ช้ามากจนใช้งานไม่ได้
เตรียมระบบ Ubuntu Server 24.04
อัปเดตระบบและติดตั้งเครื่องมือที่จำเป็นก่อนเริ่มติดตั้ง Ollama
sudo apt update && sudo apt upgrade -y
sudo apt install -y curl wget git
ตรวจสอบปริมาณ RAM บนเครื่องเพื่อเลือก Model ที่เหมาะสม:
free -h
ดูที่คอลัมน์ available ในผลลัพธ์ — นั่นคือ RAM ที่ใช้งานได้จริง ไม่ใช่ total
ติดตั้ง Ollama (วิธีมาตรฐาน)
ใช้สคริปต์ติดตั้งอย่างเป็นทางการ — คำสั่งเดียวจบ:
curl -fsSL https://ollama.com/install.sh | sh
หลังติดตั้งเสร็จ เปิด service ให้ทำงานอัตโนมัติ:
sudo systemctl enable ollama
sudo systemctl start ollama
ข้อควรรู้: สคริปต์จะติดตั้ง Ollama ไว้ที่ /usr/local/bin/ollama และสร้าง systemd service ให้อัตโนมัติ
ตรวจสอบการทำงาน
ตรวจสอบเวอร์ชัน Ollama และสถานะ service:
ollama --version
systemctl status ollama
ทดสอบว่า API ทำงานหรือยัง (ควรได้รับ Ollama is running):
curl http://localhost:11434
ถ้าได้ผลลัพธ์กลับมาแสดงว่า Ollama ทำงานปกติ พร้อมรับ Model แล้ว
ดาวน์โหลด AI Model (เลือกตาม RAM)
เลือก Model ให้เหมาะกับ RAM ของเครื่อง — คำสั่ง ollama run จะดาวน์โหลด + รันในครั้งเดียว:
llama3.2:1b
Model เล็กที่สุด เหมาะทดลองระบบ
ollama run llama3.2:1b
llama3.1:8b
สมดุลระหว่างคุณภาพและทรัพยากร
ollama run llama3.1:8b
llama3.1:13b / mistral
คุณภาพสูง เหมาะ Production
ollama run mistral
ollama run llama3.1:13b
ครั้งแรกจะช้า: Model ขนาด 8B ประมาณ 4.7 GB — หลังดาวน์โหลดแล้ว ครั้งต่อไปจะเร็วขึ้นมากเพราะมีในเครื่องแล้ว
ทดสอบใช้งาน AI (Chat Test)
เมื่อรัน Model ด้วย ollama run จะเข้าสู่โหมด REPL (พิมพ์สนทนาได้เลย):
>>> อธิบาย AI แบบง่าย ๆ
AI (Artificial Intelligence) คือระบบที่สามารถเรียนรู้...
>>> ช่วยเขียนโค้ด Python
แน่นอน! นี่คือตัวอย่าง...
หรือส่งคำถามผ่าน CLI แบบ one-shot (ไม่เข้า REPL):
ollama run llama3.1:8b "อธิบาย machine learning"
กด Ctrl + D เพื่อออกจากโหมด REPL
ทดสอบผ่าน API (สำหรับระบบจริง)
Ollama มี REST API พร้อมใช้งานที่ localhost:11434 — นี่คือหัวใจสำคัญที่ทำให้เชื่อมต่อกับแอปพลิเคชันอื่นได้:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "เขียนโค้ด Python หาค่า factorial"
}'
จุดนี้สำคัญมาก: API นี้ใช้โครงสร้างเดียวกับ OpenAI API ทำให้สามารถเชื่อมต่อกับเฟรมเวิร์กต่าง ๆ เช่น LangChain, Open WebUI ได้ทันที
โครงสร้างโมดูลระบบ (Architecture)
ลักษณะการทำงานของ Ollama แบบเป็นชั้น ๆ:
Module ทดสอบระบบ (Testing Checklist)
คลิกแต่ละรายการเพื่อทำเครื่องหมายว่าทดสอบแล้ว:
-
Test 1: Service ทำงานปกติ
systemctl status ollama -
Test 2: Model โหลดสำเร็จ
ollama list -
Test 3: Chat ทำงานได้
ollama run llama3.1:8b "hello" -
Test 4: ตรวจสอบหน่วยความจำ
htop— ดูว่า RAM ใช้ไปเท่าไร
Optimization (สำคัญมาก)
ลด RAM ที่ใช้โดยจำกัดจำนวน Model ที่โหลดพร้อมกัน:
export OLLAMA_MAX_LOADED_MODELS=1
export OLLAMA_KEEP_ALIVE=5m
เพื่อเพิ่ม performance โดยรวม:
ใช้ SSD
Model โหลดเร็วขึ้นมากเทียบกับ HDD
RAM ≥ 16GB
สำหรับ production แนะนำอย่างยิ่ง
ปิด service ไม่จำเป็น
ปล่อย RAM ให้ Ollama ใช้มากที่สุด
เคล็ดลับ: ใส่ env ไว้ใน /etc/systemd/system/ollama.service.d/override.conf เพื่อให้คงอยู่ถาวรหลังรีบูต
Troubleshooting
RAM ไม่พอ
เปลี่ยนเป็น model ขนาดเล็กลง เช่น llama3.2:1b หรือ 3B แทน 8B — ตรวจสอบด้วย free -h
ช้าเกินไป
ใช้ quantized model (เช่น Q4) เพื่อลดขนาด ลด context length หรือเพิ่ม RAM
Service ไม่ start
ดู log จริงเพื่อหาสาเหตุ:
journalctl -u ollama -f
สรุปแบบเร็ว
ขั้นต่อไป
หลังจากติดตั้งเสร็จแล้ว สามารถต่อยอดได้หลายทางเลือก: