Ollama có HTTP API local cho các thao tác sinh nội dung và quản lý model. Khi gọi API, hãy coi streaming là giao thức có trạng thái, model name là input cần xác thực, còn lỗi mạng, timeout và model loading là các trường hợp bình thường cần xử lý.
Tóm tắt nhanh
Nếu bạn đang tìm cách Ollama API, điểm mấu chốt là xây client có timeout, kiểm tra status, parse streaming và retry có điều kiện. Hãy coi đây là một bài toán vận hành có điều kiện, không phải một lệnh thần kỳ. Khi có thay đổi phần cứng, model, dữ liệu hoặc số người dùng, bạn cần đo lại các giả định quan trọng.
Cách tiếp cận thực tế
Trong môi trường self-host, một lỗi thường nằm ở ranh giới giữa nhiều lớp. Vì vậy, hãy xác định input, trạng thái mong đợi và bằng chứng quan sát được trước khi sửa. Các bước dưới đây ưu tiên thay đổi nhỏ, có thể kiểm tra và có đường quay lại.
- Thử endpoint local bằng request non-stream để hiểu response đầy đủ.
- Kiểm tra model có trong /api/tags trước khi gửi workload.
- Khi stream, đọc từng JSON line và xử lý chunk cuối có done=true.
- Phân biệt timeout ở connect, read và tổng thời gian.
- Chỉ retry lỗi tạm thời; không retry vô hạn request tạo side effect.
Ví dụ kiểm tra
Các lệnh dưới đây là khung kiểm tra, không phải cấu hình áp dụng nguyên xi cho mọi máy. Thay placeholder bằng giá trị đã được kiểm tra; không đưa credential thật vào shell history hoặc bài viết.
curl http://127.0.0.1:11434/api/tags
curl http://127.0.0.1:11434/api/generate -d '{"model":"<model>","prompt":"Xin chào","stream":false}'
curl http://127.0.0.1:11434/api/versionSau khi chạy, lưu timestamp, model/version, thông số tài nguyên và kết quả. Việc ghi chép này giúp phân biệt lỗi tái hiện được với hiện tượng nhất thời và tạo dữ liệu cho lần rollback sau.
Lỗi thường gặp và cách xử lý
- Parse streaming như một JSON duy nhất.: dừng thay đổi lan rộng, thu log liên quan, kiểm tra quyền và tài nguyên, sau đó thử lại với phạm vi nhỏ hơn.
- Retry cả lỗi 4xx do model sai.: dừng thay đổi lan rộng, thu log liên quan, kiểm tra quyền và tài nguyên, sau đó thử lại với phạm vi nhỏ hơn.
- Đặt timeout ngắn hơn thời gian sinh hợp lệ.: dừng thay đổi lan rộng, thu log liên quan, kiểm tra quyền và tài nguyên, sau đó thử lại với phạm vi nhỏ hơn.
Một hệ thống AI self-host tốt không phải là hệ thống không bao giờ lỗi; đó là hệ thống cho phép phát hiện, giới hạn ảnh hưởng và phục hồi có kiểm soát.
Góc nhìn SEO/AEO và vận hành
Với chủ đề Ollama API, câu trả lời tốt cần nêu rõ điều kiện áp dụng và cách xác minh. Đừng chỉ đưa một lệnh hoặc một con số benchmark. Hãy công bố môi trường, phiên bản, giới hạn và cách người đọc có thể tự kiểm tra trên máy của họ.
Khi làm việc với Ollama, nên đối chiếu tài liệu Ollama về usage metrics và API list models của Ollama; các trường usage, model size và digest có thể giúp log vận hành có ngữ cảnh hơn.
Checklist trước khi đưa vào dùng thật
- Model được validate trước khi gọi.
- Client xử lý cả stream và non-stream.
- Có correlation ID trong log.
- Retry có backoff và giới hạn.
Câu hỏi thường gặp
Endpoint Ollama mặc định là gì?
API thường lắng nghe ở localhost:11434; hãy kiểm tra cấu hình thực tế và không public tùy tiện.
Streaming có bắt buộc không?
Không; non-stream đơn giản hơn, stream phù hợp UX phản hồi dần.
API trả 200 nhưng response lỗi thì sao?
Vẫn phải kiểm tra JSON, trường done, error và nội dung, không chỉ dựa status code.
Tài liệu tham khảo chính thống
Các liên kết dưới đây là điểm bắt đầu để đối chiếu phiên bản, tham số và giới hạn trước khi áp dụng vào môi trường thật.
Kết luận
Gọi Ollama qua API: endpoint, streaming, model và xử lý lỗi nên được triển khai như một bước trong chuỗi, không phải một cấu hình độc lập. Hãy lưu lại kết quả kiểm tra, pin những phiên bản quan trọng và chỉ mở rộng khi đã có giới hạn tài nguyên cùng phương án khôi phục. Ở tập tiếp theo, serial sẽ tiếp tục từ nền tảng này để đi sâu hơn vào vận hành AI self-host.