AI2026-09-196 min read

Routing Patterns: Các mẫu định tuyến thông minh trong hệ thống AI Agent

Khám phá kỹ thuật định tuyến yêu cầu (Routing) trong kiến trúc AI: Phân loại ý định, định tuyến dựa trên vector embedding, mô hình máy học phân loại và chiến lược tối ưu hóa chi phí đa mô hình.

Nguyen Pham
Xin chào. Mình thích lập trình và công nghệ. Đây là blog mình chia sẻ lại các kiến thức về lập trình, công nghệ.

Trong các hệ thống AI quy mô lớn, không có một mô hình đơn lẻ nào là lựa chọn tối ưu cho mọi tác vụ. Một câu hỏi tính toán đơn giản không cần đến mô hình nghìn tỷ tham số đắt đỏ, và một bài toán suy luận đa tầng phức tạp không thể giao cho một mô hình rút gọn.

Routing Pattern (Mẫu định tuyến) đóng vai trò như một "nhà điều phối thông minh" (smart dispatcher), chịu trách nhiệm phân tích đặc tính của câu hỏi đầu vào để tự động chuyển tiếp yêu cầu đến mô hình, công cụ hoặc luồng xử lý chuyên biệt phù hợp nhất.


1. Lợi ích cốt lõi của việc Định tuyến trong AI#

  1. Tối ưu hóa Chi phí (Cost Optimization):
    • 70-80% yêu cầu thông thường của người dùng có thể được xử lý hoàn hảo bởi các mô hình nhỏ (như GPT-4o-mini, Claude 3.5 Haiku, Gemini Flash). Chỉ 20% còn lại mới cần kích hoạt các mô hình siêu suy luận. Định tuyến thông minh giúp doanh nghiệp cắt giảm 50-70% hóa đơn API hàng tháng.
  2. Cải thiện Tốc độ phản hồi (Latency Optimization):
    • Các mô hình nhỏ phản hồi nhanh hơn gấp 3-5 lần, mang lại trải nghiệm tương tác tức thì cho người dùng đối với các câu hỏi đơn giản.
  3. Chuyên môn hóa tác vụ (Specialized Capabilities):
    • Định tuyến câu hỏi về mã nguồn đến mô hình chuyên code, tác vụ phân tích ảnh đến mô hình thị giác (Vision), và câu hỏi nghiệp vụ đến hệ thống RAG nội bộ.
  4. Tăng cường khả năng chịu lỗi (Fallback & Redundancy):
    • Tự động chuyển hướng sang mô hình dự phòng khi nhà cung cấp chính gặp sự cố mạng hoặc bị giới hạn tốc độ (rate limit).

2. 4 Kỹ thuật Định tuyến phổ biến nhất#

2.1. Rule-Based Routing (Định tuyến dựa trên luật)#

  • Cơ chế: Sử dụng các biểu thức chính quy (Regex), từ khóa định sẵn hoặc cây quyết định logic lập trình (if/else).
  • Ưu điểm: Cực nhanh (dưới 1ms), độ tin cậy tuyệt đối, không tốn chi phí token.
  • Nhược điểm: Cứng nhắc, không hiểu được sự đa dạng về ngữ nghĩa tự nhiên của người dùng.

2.2. Embedding-Based Semantic Routing (Định tuyến ngữ nghĩa bằng Vector)#

  • Cơ chế: Lưu trữ các vector biểu diễn của từng danh mục/ý định trong cơ sở dữ liệu vector. Khi người dùng gửi câu hỏi, hệ thống tính toán vector embedding của câu hỏi và so sánh độ tương đồng cosine (Cosine Similarity) với các định tuyến có sẵn.
  • Ưu điểm: Rất nhanh (10-30ms), bắt trọn ngữ nghĩa tương đương mà không phụ thuộc vào từ khóa chính xác.
  • Thư viện phổ biến: semantic-router của Aurelio AI.

2.3. ML Model-Based Routing (Định tuyến bằng mô hình phân loại nhẹ)#

  • Cơ chế: Huấn luyện một mô hình phân loại nhỏ gọn (như BERT, DeBERTa hoặc Logistic Regression) trên tập dữ liệu gắn nhãn ý định người dùng.
  • Ưu điểm: Thời gian suy diễn dưới 10ms, chạy trực tiếp trên CPU hoặc máy chủ nội bộ mà không cần gọi API đám mây.

2.4. LLM-Based Routing (Định tuyến bằng chính LLM)#

  • Cơ chế: Dùng một prompt ngắn yêu cầu một mô hình LLM siêu nhanh (ví dụ Gemini Flash) phân loại yêu cầu người dùng thành các nhãn JSON có cấu trúc.
  • Ưu điểm: Khả năng hiểu ngữ cảnh tinh tế và phức tạp nhất, dễ dàng thay đổi luật định tuyến bằng prompt.
  • Nhược điểm: Tốn thêm một lần gọi API nhỏ và độ trễ khoảng 200-400ms.

3. Kiến trúc Bộ định tuyến kết hợp (Hybrid Router Architecture)#

Trong thực tế sản xuất, giải pháp tối ưu là xây dựng kiến trúc định tuyến đa tầng (Tiered Routing):

text
[Yêu cầu từ người dùng]
         │
         ▼
[Tầng 1: Kiểm tra Luật & Từ khóa] ──(Khớp)──► [Phản hồi nhanh/Công cụ tĩnh]
         │ (Không khớp)
         ▼
[Tầng 2: Semantic Router (Vector)] ──(Độ tương đồng > 0.85)──► [Handler chuyên biệt]
         │ (Độ tin cậy thấp)
         ▼
[Tầng 3: LLM Router phân loại sâu] ────────► [Mô hình suy luận cao cấp]

4. Những cạm bẫy cần tránh khi triển khai#

  • Bộ định tuyến trở thành điểm nghẽn (Single Point of Failure): Nếu bộ định tuyến gặp sự cố, toàn bộ hệ thống phía sau sẽ tê liệt. Luôn có lộ trình mặc định (default fallback route).
  • Chi phí định tuyến vượt quá chi phí xử lý: Nếu câu hỏi chỉ cần tóm tắt 1 câu mà bộ định tuyến mất 0.5 giây và gọi 2 mô hình khác nhau để phân loại, bạn đang lãng phí tài nguyên.
  • Thiếu giám sát và cập nhật: Hành vi và câu hỏi của người dùng luôn biến đổi. Cần liên tục theo dõi nhật ký định tuyến để phát hiện các truy vấn bị phân loại nhầm.
Tags:#AI#AI Agent#Routing#Architecture#LLM
Routing Patterns: Các mẫu định tuyến thông minh trong hệ thống AI Agent — Blog — VDaily