Prompt Caching: Giảm Chi Phí Gọi API Claude
Cách bật cache cho phần ngữ cảnh lặp lại trong API Claude để giảm đáng kể chi phí và độ trễ khi gọi nhiều lần trên cùng một tài liệu dài.
Hoá đơn API Claude tháng đầu làm mình giật mình, không phải vì gọi nhiều, mà vì mỗi lần gọi đều gửi lại nguyên một tài liệu dài làm ngữ cảnh. Bật prompt caching xong, hoá đơn tháng sau giảm hẳn dù số lượt gọi gần như không đổi.

Prompt caching là gì
Là cơ chế cho phép lưu tạm phần ngữ cảnh lặp lại giữa các lần gọi API, ví dụ một tài liệu tham chiếu dài hay một bộ hướng dẫn hệ thống cố định, để những lần gọi sau không phải xử lý lại từ đầu phần đó, chỉ tính phí thấp hơn nhiều cho phần đã cache.
📌 Chưa chắc nên chọn gì? Đọc trước Học AI: Dùng Claude, ChatGPT, Gemini Đúng Việc — hướng dẫn tổng hợp của Kudomax về học ai.
Khi nào đáng bật
- Gọi API nhiều lần trên cùng một tài liệu dài: ví dụ hỏi liên tiếp nhiều câu về cùng một bộ hợp đồng hay báo cáo.
- Prompt hệ thống cố định, dài dùng chung cho hàng nghìn lượt gọi mỗi ngày trong một ứng dụng.
- Ứng dụng cần phản hồi nhanh: cache còn giảm cả độ trễ, không chỉ chi phí, vì phần đã cache không cần xử lý lại.
Khi nào không cần
Nếu mỗi lần gọi API dùng ngữ cảnh hoàn toàn khác nhau, cache không giúp được gì vì không có phần lặp lại để tận dụng. Cache cũng có thời gian hết hạn, nên ứng dụng gọi quá thưa, cách nhau nhiều giờ, sẽ thấy phần cache đã hết hạn trước khi dùng lại, không tiết kiệm được như kỳ vọng.
Cách áp dụng thực tế
Sắp xếp phần nội dung cố định, ít đổi lên trước trong request, như tài liệu tham chiếu hay hướng dẫn hệ thống, rồi để phần thay đổi theo từng câu hỏi ở cuối. Đánh dấu đúng phần cần cache theo tài liệu API, phần càng ổn định giữa các lần gọi càng nên đưa vào cache.
Nếu bạn đang tự dựng agent chạy nhiều lượt gọi liên tiếp, xem thêm Claude Agent SDK để biết cách tích hợp cache ngay trong vòng lặp agent.




