API của LLM trông chỉ như một request và một response, nhưng khi triển khai thực tế, mọi vấn đề đều ẩn trong chi tiết: Token được tiêu tốn thế nào, vì sao context window không đủ, tham số sampling có khiến câu trả lời dao động không, vì sao output có cấu trúc đôi khi thất bại, trước khi lên production làm sao chứng minh hiệu quả thực sự đã tốt hơn.
18/9/26Khoảng 3 phút
