Chạy mô hình AI cục bộ với Ollama: Hướng dẫn từng bước cho người mới
Mục lục bài viết
- 1. Ollama là gì và vì sao nên chạy AI cục bộ?
- 2. Yêu cầu phần cứng: Chọn mô hình phù hợp với máy
- 3. Cài đặt Ollama trên Windows, macOS và Linux
- 4. Tải và chạy mô hình đầu tiên
- 5. Các lệnh Ollama hữu ích cho người dùng hàng ngày
- 6. Tùy chỉnh mô hình và mở rộng với công cụ bên ngoài
- 7. Khi nào nên dùng AI cục bộ và khi nào dùng đám mây
- Câu hỏi thường gặp (FAQ)
1. Ollama là gì và vì sao nên chạy AI cục bộ?
Ollama là công cụ mã nguồn mở giúp tải và chạy các mô hình ngôn ngữ lớn (LLM) ngay trên máy tính cá nhân, không cần gửi dữ liệu lên đám mây. Chỉ với vài lệnh trong terminal, bạn có thể chạy Llama 3.1, Mistral, Phi 3 hoặc Gemma như một trợ lý AI riêng của mình.
Khác với ChatGPT hay Gemini chạy trên máy chủ của công ty, AI cục bộ chạy hoàn toàn trên phần cứng của bạn. Điều này mang lại quyền riêng tư tuyệt đối, không tốn phí thuê bao và hoạt động tốt cả khi mất internet.
- Riêng tư tuyệt đối: dữ liệu không bao giờ rời khỏi máy.
- Miễn phí: không trả phí theo lượt hay theo tháng.
- Hoạt động offline: dùng được ngay cả khi mất mạng.
- Tùy biến sâu: thay đổi mô hình, system prompt và tham số tự do.
2. Yêu cầu phần cứng: Chọn mô hình phù hợp với máy
Mô hình càng lớn càng thông minh nhưng càng tốn bộ nhớ. Yếu tố quyết định là RAM và VRAM (bộ nhớ card đồ họa), không phải CPU.
- Mô hình 3B-8B (Llama 3.1 8B, Phi 3 Mini): cần khoảng 4-8GB RAM, chạy được trên laptop phổ thông với tốc độ chấp nhận được.
- Mô hình 13B-14B (Mistral, Llama 3 8B bản lượng tử): cần 8-16GB RAM, nên có card đồ họa 8GB VRAM để chạy mượt.
- Mô hình 70B (Llama 3 70B): cần ít nhất 32-48GB RAM hoặc nhiều card đồ họa, thường chỉ dành cho máy trạm.
Máy Mac chip Apple Silicon (M1 trở lên) chạy Ollama rất tốt nhờ bộ nhớ hợp nhất. Laptop Windows nên ưu tiên máy có card NVIDIA để dùng CUDA tăng tốc xử lý.
3. Cài đặt Ollama trên Windows, macOS và Linux
Cách cài đặt phụ thuộc vào hệ điều hành, nhưng quy trình đều đơn giản và mất chưa đầy 5 phút.
- Windows: tải file cài đặt từ trang chủ ollama.com, chạy và làm theo hướng dẫn. Sau khi cài, mở Command Prompt hoặc PowerShell và gõ
ollama --version. - macOS: tải file
.dmgtừ trang chủ, kéo biểu tượng vào thư mục Applications, sau đó mở Terminal và kiểm tra bằngollama --version. - Linux: chạy lệnh
curl -fsSL https://ollama.com/install.sh | shtrong terminal. Script tự cài đặt và cấu hình dịch vụ chạy nền.
Sau khi cài đặt, Ollama chạy như một dịch vụ nền (background service) trên cổng 11434. Bạn không cần làm gì thêm, chỉ cần mở terminal mới để sử dụng lệnh.
ollama không được nhận diện, hãy đóng và mở lại terminal, hoặc đăng xuất rồi đăng nhập lại để biến môi trường được cập nhật.4. Tải và chạy mô hình đầu tiên
Mở terminal và chạy lệnh ollama run llama3.1. Lần đầu tiên, Ollama tự tải mô hình khoảng 4-5GB, sau đó mở giao diện trò chuyện ngay trong terminal.
(1) Gõ ollama run llama3.1 và chờ quá trình tải hoàn tất.
(2) Nhập câu hỏi đầu tiên, ví dụ: "Giới thiệu về Việt Nam bằng 3 câu".
(3) Gõ /bye để thoát phiên trò chuyện.
Bạn có thể tải trước mô hình mà không chạy ngay bằng lệnh ollama pull llama3.1. Lệnh ollama list hiển thị các mô hình đã tải, ollama rm llama3.1 xóa mô hình khi không cần dùng.
llama3.1, mistral, phi3, gemma2. Gõ ollama list hoặc truy cập thư viện mô hình trên trang chủ Ollama để xem danh sách đầy đủ.5. Các lệnh Ollama hữu ích cho người dùng hàng ngày
ollama run: mở phiên trò chuyện với mô hình.ollama pull: tải mô hình về máy.ollama list: xem danh sách mô hình đã tải.ollama ps: xem mô hình đang chạy và dung lượng bộ nhớ đang dùng.ollama stop: dừng mô hình đang chạy để giải phóng RAM.ollama rm: xóa mô hình khỏi máy.
Khi không dùng, Ollama tự động dỡ mô hình khỏi bộ nhớ sau vài phút để máy không bị chậm. Nếu muốn giải phóng RAM ngay, dùng lệnh ollama stop.
/help trong phiên trò chuyện để xem các lệnh nội bộ như /set temperature, /set system để thay đổi tính cách trợ lý, hoặc /save để lưu phiên làm việc.6. Tùy chỉnh mô hình và mở rộng với công cụ bên ngoài
Ollama cung cấp API tương thích OpenAI ngay tại http://localhost:11434, nghĩa là nhiều ứng dụng viết cho ChatGPT có thể trỏ về Ollama mà không cần sửa code nhiều.
- Open WebUI: giao diện web đẹp mắt giống ChatGPT, chạy bằng Docker và kết nối trực tiếp với Ollama.
- VS Code + Continue: trợ lý lập trình cục bộ, gợi ý code mà không gửi mã nguồn lên mạng.
- Python: thư viện
ollamacho phép gọi mô hình trong script xử lý văn bản, tóm tắt tài liệu hàng loạt. - Modelfile: file cấu hình để tạo mô hình tùy chỉnh với system prompt và tham số riêng.
7. Khi nào nên dùng AI cục bộ và khi nào dùng đám mây
AI cục bộ phù hợp với tác vụ cần bảo mật, chi phí cố định và làm việc offline. AI đám mây vượt trội về độ thông minh của mô hình lớn nhất, tốc độ xử lý và khả năng đa phương thức như nhận diện ảnh, video.
Chiến lược hiệu quả nhất là kết hợp cả hai: dùng Ollama cho công việc hàng ngày như soạn thảo, tóm tắt, hỏi đáp kiến thức; dùng dịch vụ đám mây cho những tác vụ phức tạp cần mô hình mạnh nhất.
🙋 Câu hỏi thường gặp
Chạy AI cục bộ có tốn điện và làm chậm máy không?
Khi chạy mô hình, CPU và GPU hoạt động ở mức cao nên máy tiêu thụ nhiều điện hơn và quạt có thể ồn hơn. Tuy nhiên Ollama tự động dỡ mô hình khỏi bộ nhớ khi không dùng, nên máy trở lại bình thường ngay sau đó. Nếu máy cấu hình thấp, hãy chọn mô hình 3B-7B để cân bằng giữa chất lượng và hiệu năng.
Ollama có hỗ trợ tiếng Việt không?
Có. Các mô hình như Llama 3.1, Mistral và Gemma 2 xử lý tiếng Việt khá tốt cho nhu cầu hỏi đáp, soạn thảo và tóm tắt. Chất lượng không bằng các dịch vụ đám mây lớn nhưng đủ dùng cho công việc hàng ngày. Bạn có thể cải thiện thêm bằng cách yêu cầu mô hình trả lời bằng tiếng Việt ngay trong system prompt.
Máy không có card đồ họa rời có chạy được Ollama không?
Hoàn toàn được. Ollama chạy trên CPU, chỉ là tốc độ chậm hơn. Với mô hình 7B-8B chạy trên CPU, thời gian phản hồi khoảng 5-15 giây cho mỗi câu trả lời, chấp nhận được cho nhu cầu soạn thảo và hỏi đáp. Máy Mac Apple Silicon chạy đặc biệt tốt nhờ bộ nhớ hợp nhất.