Hướng dẫn thực hànhHướng dẫn

AI agent là gì? Hướng dẫn hiểu bộ nhớ, lập kế hoạch và phân quyền

Hôm nay mình sẽ hướng dẫn anh em tìm hiểu sâu để biết rõ AI agent là gì, từ cách nó suy nghĩ tới việc phân chia quyền hạn khi xử lý việc phức tạp.

Qua bài này anh em sẽ biết một agent gồm những phần nào, bộ nhớ của nó chia ra sao và nên đặt ranh giới an toàn thế nào khi dùng vào việc thật.

Toàn bộ kiến thức trong bài được mình tổng hợp trực tiếp từ tài liệu kỹ thuật của Google và OpenAI, và mình chưa tự chạy thử trên môi trường thực tế.

Nhiều anh em hiện nay vẫn nhầm lẫn agent với chatbot thông thường. Điểm khác biệt nằm ở khả năng chủ động theo đuổi mục tiêu. Hiểu đúng agent là gì thì anh em giao việc sẽ đỡ sai hơn.

Bước 1: Phân biệt rõ giữa bot, trợ lý và agent

Theo tài liệu của Google, AI agent là hệ thống phần mềm dùng AI để theo đuổi mục tiêu và hoàn thành nhiệm vụ thay người dùng. Nó có độ tự chủ cao nhất trong ba loại: tự quyết định, học dần theo thời gian và điều chỉnh khi tình huống đổi.

Khối gỗ lắp ráp ăn khớp với ba bánh răng đồng đặt trên mặt bàn gỗ tối màu.

Bot thông thường chỉ chạy theo các quy tắc cứng lập trình sẵn. Trợ lý AI thì ở mức giữa và phản hồi khi nhận lệnh. Trợ lý có thể gợi ý nhưng quyền quyết định vẫn thuộc về con người.

Agent chủ động theo đuổi mục tiêu, tự quyết định nhiều bước mà không cần người dùng chỉ từng việc. Với việc nhạy cảm, mình vẫn nên bắt nó hỏi duyệt trước.

Google nói agent dựa vào AI multimodal (hiểu cùng lúc chữ, ảnh, âm thanh) nên xử lý được cùng lúc văn bản, giọng nói, video, âm thanh và code. Nhờ nhận được nhiều loại dữ liệu, agent hiểu ngữ cảnh rõ hơn. Agent cũng có thể phối hợp với agent khác để làm những quy trình nhiều bước phức tạp hơn.

Bước 2: Thiết lập cơ chế lập kế hoạch và hành động

Agent không chỉ viết chữ như chatbot, nó còn phải tự lên kế hoạch cho việc cần làm. Tài liệu của Google chỉ ra rằng cơ chế của agent xoay quanh hai trục chính là suy luận và hành động. Cách làm này có tên là ReAct (viết tắt của Reasoning và Acting): agent vừa suy luận (nghĩ xem nên làm gì) vừa hành động (làm thật), rồi xem kết quả để nghĩ tiếp.

Khi lập kế hoạch, agent phải đoán trước bước tiếp theo sẽ ra sao và xem có gì cản đường không. Sau khi nhận việc, agent sẽ cân nhắc các hành động nó làm được rồi chọn hướng tốt nhất dựa trên thông tin đang có.

Agent quan sát môi trường qua nhiều kiểu dữ liệu, ví dụ văn bản, hình ảnh hoặc dữ liệu từ cảm biến. Khi thao tác lỗi, agent phân tích phản hồi để điều chỉnh hành vi.

Google chỉ nói agent có khả năng tự cải thiện từ phản hồi. Mức độ cải thiện thì mình chưa có dữ liệu, anh em tự thử.

Bước 3: Cấu hình bốn loại memory cho agent

Không có bộ nhớ thì agent quên hết sau mỗi lượt trao đổi, nên làm project dài hơi với nó gần như vô ích. Google chia cấu trúc bộ nhớ của agent thành bốn loại memory riêng biệt. Mỗi loại lo một việc riêng.

Chồng ngăn kéo mica trong suốt phát ánh sáng dịu đặt giữa thư viện tối.

Loại đầu là short-term memory, lưu thông tin trong phiên chat đang diễn ra. Tầng thứ hai là long-term memory (bộ nhớ dài hạn), lưu dữ liệu lịch sử và các cuộc trò chuyện cũ để agent nhớ lại khi cần. Bộ nhớ dài hạn giúp anh em không phải nhắc lại yêu cầu cũ.

Tầng thứ ba là "episodic memory", dùng để ghi lại toàn bộ các lần tương tác trước đó giúp hệ thống rút kinh nghiệm. Tầng cuối là "consensus memory", dùng để chia sẻ thông tin chung giữa các agent với nhau. Loại bộ nhớ này giúp cả dàn AI làm việc ăn khớp với nhau.

Nếu anh em dùng agent có sẵn thì không phải tự dựng mấy tầng nhớ này. Anh em chỉ cần viết sẵn một đoạn mô tả vai trò, giọng trả lời và danh sách công cụ, ví dụ: 'Bạn là trợ lý chăm sóc khách hàng, trả lời ngắn gọn, chỉ được đọc email và soạn nháp.'

Việc của mình là khai báo persona, tức là viết rõ vai trò, phong cách trả lời và danh sách công cụ cho agent ngay từ đầu. Sau đó anh em thử hỏi lại một thông tin đã nói từ đầu phiên, ví dụ tên khách hàng hay yêu cầu ban đầu, để xem nó còn nhớ không.

Bước 4: Phân quyền công cụ và kiểm soát thực thi

Công cụ là thứ để agent làm việc với thế giới bên ngoài, ví dụ gửi email hay kích hoạt một quy trình. Nếu anh em trao quyền quá rộng mà thiếu đi các ranh giới kiểm soát, agent có thể vô tình xóa nhầm dữ liệu quan trọng hoặc tự ý chạy thao tác gây hại.

Mình khuyên anh em chỉ cho agent đúng những công cụ nó cần. Cách làm: viết ra vài việc agent phải làm, ví dụ đọc email khách, tóm tắt, soạn nháp trả lời. Với mỗi việc, chỉ cấp công cụ đọc hoặc soạn, còn gửi đi hoặc xoá thì để chế độ phải duyệt tay.

Phần dưới chủ yếu dành cho dev đang dùng API của OpenAI. Nếu anh em không code, chỉ cần nhớ một ý: hỏi dev hoặc nhà cung cấp xem có chỗ nào chèn bước duyệt tay trước khi agent gọi công cụ không. Anh em không code thì có thể nhảy thẳng tới mục 'Lỗi hay gặp khi giao việc cho agent'.

Phía OpenAI đã ngừng hẳn Assistants API từ ngày 26/08/2026 và khuyên dùng Responses API cho các tích hợp mới. Nguồn cũng cảnh báo prompt object tái sử dụng sắp bị deprecate, nên ai đang dựng lâu dài thì xem lịch deprecate của OpenAI trước.

Với dev: trong Responses API, code của anh em tự quản vòng lặp gọi công cụ (nguồn gọi là "tool call loop is explicitly managed"), nên anh em chèn bước kiểm tra hoặc xin duyệt trước mỗi lần agent gọi công cụ được. OpenAI cho anh em lưu phần cấu hình (chọn model, công cụ, hướng dẫn cho AI) thành một prompt trong dashboard. Việc điều phối agent, gồm cả vòng lặp gọi công cụ, thì code của anh em lo.

Trong tài liệu của OpenAI, ví dụ code dùng model gpt-6-astra, còn ví dụ JSON phản hồi ghi gpt-5.5, nên anh em đừng chép nguyên tên model mà hãy chọn model theo nhu cầu của mình.

Trong cách mới của OpenAI, cuộc trò chuyện (conversation) là một chuỗi các mục (item). Mỗi lần gọi công cụ được ghi thành một item riêng. Nhờ vậy, anh em có chỗ để chen vào kiểm soát từng lượt gọi công cụ.

Anh em nên theo dõi lượng token mỗi lượt dùng trong trang quản lý chi phí của nhà cung cấp. Agent chạy vòng lặp liên tục thì chi phí tăng khá nhanh.

Nếu cần cho agent chạy thật trên mạng, Google gợi ý Cloud Run là lựa chọn phù hợp để deploy mà mình không phải tự quản server. Cloud Run tự tăng số máy chạy khi có nhiều việc và giảm về không khi agent rảnh, nên anh em chỉ trả tiền lúc nó chạy.

Lỗi hay gặp khi giao việc cho agent

Đừng giao agent những việc như trị liệu tâm lý, công tác xã hội, hay các quyết định đạo đức nặng như y tế (chẩn đoán, điều trị) và tư pháp. Đây là các ví dụ Google nêu là agent làm kém.

Google lưu ý là agent hay chật vật ở mấy việc cần hiểu cảm xúc hay cần tinh tế trong giao tiếp. Nên mấy việc đó anh em đừng giao. Agent mạnh ở logic và xử lý dữ liệu, còn đồng cảm thì nó yếu.

Mình thấy còn một điểm yếu nữa: những việc có vấn đề đạo đức nặng, hoặc việc ngoài đời thật mà không ai lường trước được rủi ro. Agent phân tích dữ liệu rất nhanh, nhưng nó không có phán đoán đạo đức, nên mình phải là người chịu trách nhiệm cho quyết định cuối. Google cũng lưu ý là làm và chạy agent phức tạp khá tốn tài nguyên tính toán, nên dự án nhỏ ngân sách ít cần cân nhắc.

Để tránh rủi ro, anh em nên bật bước approval (agent phải hỏi mình duyệt) trước mọi hành động đụng tới dữ liệu chung. Nếu công cụ đang dùng chưa có nút approval thì tự đặt luật: agent chỉ soạn nháp, mình bấm gửi.

Hãy bắt đầu từ một việc hẹp, ví dụ tóm tắt email khách hàng và soạn nháp trả lời. Trong tuần đầu, anh em đọc từng bản nháp trước khi cho gửi.

Cứ mỗi tuần mình xem lại những gì agent đã làm, thấy sai chỗ nào thì siết quyền chỗ đó trước khi mở thêm. Anh em cứ giao quyền từ từ và có kiểm soát thì dùng agent mới bền.

Nguồn tham khảo

  1. what-are-ai-agents · cloud.google.com · Tài liệu kỹ thuật · đọc ngày
  2. overview · platform.openai.com · Tài liệu kỹ thuật · đọc ngày

Bài này thế nào?

Chia sẻ

XFacebook

Ảnh đại diện của chủ trang quanbi.dev

Về mình

Quân Bi · Người viết

Xem thêm →

Bình luận (0)

Chưa có bình luận nào. Bạn mở hàng nhé.

Viết bình luận