Agent không phải là “chatbot biết gọi Tools”. Khi nhiệm vụ trở nên dài hơn, nó phải xử lý state, Memory, permission, retry khi thất bại, cắt gọn context và ranh giới thực thi.
Agent không phải là “chatbot biết gọi Tools”. Khi nhiệm vụ trở nên dài hơn, nó phải xử lý state, Memory, permission, retry khi thất bại, cắt gọn context và ranh giới thực thi.
API của LLM trông chỉ như một request và một response, nhưng khi triển khai thực tế, mọi vấn đề đều ẩn trong chi tiết: Token được tiêu tốn thế nào, vì sao context window không đủ, tham số sampling có khiến câu trả lời dao động không, vì sao output có cấu trúc đôi khi thất bại, trước khi lên production làm sao chứng minh hiệu quả thực sự đã tốt hơn.
RAG không chỉ là “chia nhỏ tài liệu + vector retrieval”. Parsing, phân quyền, ranking, generation, updating và evaluation đều ảnh hưởng đến câu trả lời cuối cùng.
Prompt Demo chạy được chỉ cho thấy model đã đưa ra một câu trả lời dùng được trong một mẫu nào đó. Khi đưa vào production, vẫn cần giải quyết các vấn đề engineering: route model thế nào, fallback ra sao khi thất bại, phân bổ chi phí Token thế nào, khôi phục một request Agent ra sao, ai cấp quyền và audit các Tool nhạy cảm.