AI2026-09-198 min read

Context Management: Kỹ nghệ Quản trị và Tối ưu Cửa sổ Ngữ cảnh cho AI Agent

Khám phá nghệ thuật quản trị cửa sổ ngữ cảnh (Context Engineering): Nén ngữ nghĩa, tối ưu bộ đệm KV Cache, Filesystem-as-Context và kỹ thuật dọn dẹp kết quả công cụ (Tool-Result Clearing).

Nguyen Pham
Xin chào. Mình thích lập trình và công nghệ. Đây là blog mình chia sẻ lại các kiến thức về lập trình, công nghệ.

Mặc dù các mô hình ngôn ngữ lớn hiện nay đã hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu hay 2 triệu token, nhưng thực tế kỹ thuật cho thấy: Càng nhồi nhiều token vào prompt, mô hình càng dễ bị phân tâm, chi phí càng bùng nổ và độ trễ càng tăng cao.

Context Management (Quản trị ngữ cảnh) là bộ các kỹ thuật chiến lược giúp duy trì thông tin thiết yếu nhất trong cửa sổ làm việc của Agent, tối ưu hóa chi phí token và đảm bảo mô hình luôn hoạt động ở trạng thái sắc bén nhất.


1. Những cạm bẫy khi lạm dụng Cửa sổ Ngữ cảnh Khổng lồ#

  1. Hiện tượng "Lost in the Middle" (Quên thông tin ở giữa): Khả năng chú ý của kiến trúc Transformer tập trung mạnh nhất vào phần đầu (hệ thống prompt) và phần cuối (câu hỏi gần nhất). Dữ liệu nằm ở giữa tài liệu dài thường bị mô hình bỏ sót.
  2. Context Poisoning (Nhiễm độc ngữ cảnh): Khi Agent thực hiện nhiều vòng lặp, các kết quả tìm kiếm rác hoặc các phép thử sai lầm tích tụ trong lịch sử sẽ làm "nhiễm độc" chuỗi suy luận tiếp theo.
  3. Chi phí tài chính và thời gian: Độ trễ Time-to-First-Token (TTFT) tăng tuyến tính theo độ dài của ngữ cảnh đầu vào.

2. Các kỹ thuật Quản trị Ngữ cảnh Hiện đại#

2.1. Context Editing & Tool-Result Clearing (Dọn dẹp kết quả công cụ cũ)#

  • Vấn đề: Trong một phiên làm việc dài (như coding agent sửa bug), các kết quả đọc file lớn hoặc log terminal từ 10 lượt trước vẫn nằm nguyên trong ngữ cảnh dù không còn dùng tới.
  • Giải pháp: Tự động thay thế các khối kết quả công cụ cũ (tool_result) bằng một câu tóm tắt 1 dòng hoặc một placeholder ngắn, trong khi vẫn giữ nguyên lịch sử gọi hàm (tool_use). Vì dữ liệu file có thể đọc lại bất cứ lúc nào, giải pháp này giúp giảm tới 84% số token tiêu thụ mà không làm mất đi khả năng phục hồi dữ liệu!

2.2. Filesystem as Context (Đưa ngữ cảnh ra hệ thống tệp ngoài)#

  • Thay vì giữ toàn bộ dữ liệu trung gian trong bộ nhớ token đắt đỏ, Agent chủ động ghi các bảng dữ liệu lớn hoặc kết quả cào web ra các tệp tạm trên đĩa (scratchpad/data.json).
  • Agent chỉ giữ lại đường dẫn tệp trong prompt và dùng các lệnh như grep hoặc view_file để đọc từng phần nhỏ khi cần.

2.3. Sliding Window với Tóm tắt Ngữ nghĩa (Summarization Compaction)#

  • Khi lịch sử hội thoại chạm 80% giới hạn token, hệ thống tự động kích hoạt một lời gọi LLM chạy ngầm để tóm tắt 50% các tin nhắn cũ nhất thành một bản ghi nhớ súc tích, giữ nguyên các tin nhắn mới nhất.

2.4. Tối ưu hóa KV Cache (KV Cache Optimization & Prefix Caching)#

  • Giữ cho phần đầu của prompt (System Prompt, Tool Declarations, Few-shot Examples) hoàn toàn cố định và không thay đổi giữa các lượt hội thoại.
  • Điều này cho phép các máy chủ suy diễn (như vLLM hoặc OpenAI API) tái sử dụng lại bộ nhớ đệm KV Cache đã tính toán từ trước, giúp giảm tới 80% độ trễ và được hưởng mức giá chiết khấu token đầu vào (Prompt Caching Discount).
Tags:#AI#AI Agent#Context Management#KV Cache#Performance
Context Management: Kỹ nghệ Quản trị và Tối ưu Cửa sổ Ngữ cảnh cho AI Agent — Blog — VDaily