---
title: "Hybrid RAG Systems: Kiến trúc RAG Lai kết hợp Dense, Sparse và Đồ thị tri thức"
description: "Phân tích kiến trúc RAG Lai (Hybrid Retrieval-Augmented Generation): Kết hợp tìm kiếm ngữ nghĩa Dense Vector với tìm kiếm từ khóa Sparse (BM25), xếp hạng lại Reranking và bảo mật dữ liệu."
date: "2026-09-19"
author:
  name: "Nguyen Pham"
  role: "Xin chào. Mình thích lập trình và công nghệ. Đây là blog mình chia sẻ lại các kiến thức về lập trình, công nghệ."
  avatar: "http://0.gravatar.com/avatar/6fb61398e24046b34e13870dd6c357b9?s=128&d=mm&r=g"
category: "AI"
tags: ["AI", "RAG", "Hybrid Search", "Vector Search", "BM25"]
coverImage: "/blog/covers/retrieval-augmented-hybrid-systems.png"
featured: false
readingTime: "6 min read"
---

Trong các ứng dụng thực tế, không có một phương pháp tìm kiếm đơn lẻ nào là hoàn hảo. Tìm kiếm vector dày đặc (*Dense Vector Search*) rất xuất sắc trong việc nắm bắt ý định trừu tượng và ngữ nghĩa tương đồng, nhưng lại thường xuyên thất bại trước các từ khóa chính xác như mã số sản phẩm (SKU), số hiệu hợp đồng, tên riêng hiếm gặp hoặc biệt ngữ chuyên ngành. Ngược lại, tìm kiếm từ khóa kinh điển (*Sparse Search như BM25*) làm rất tốt việc khớp từ chính xác nhưng hoàn toàn "mù" trước các từ đồng nghĩa và biến thể ngữ cảnh.

**Retrieval-Augmented Hybrid Systems (Hệ thống RAG Lai)** giải quyết triệt để vấn đề này bằng cách phối hợp đa kênh truy xuất, kết hợp sức mạnh của Dense Retrieval, Sparse Retrieval và Đồ thị tri thức.

---

## 1. Mô hình Luồng dữ liệu trong Hệ thống RAG Lai

```text
               [Truy vấn của người dùng]
                          │
           ┌──────────────┴──────────────┐
           ▼                             ▼
   [Dense Search (Vector)]      [Sparse Search (BM25)]
   (Ngữ nghĩa, ý định)          (Từ khóa chính xác, mã hiệu)
           │                             │
           └──────────────┬──────────────┘
                          ▼
           [Reciprocal Rank Fusion (RRF)]
           (Hợp nhất danh sách ứng viên)
                          │
                          ▼
             [Reranker (Cross-Encoder)]
             (Chấm điểm độ liên quan sâu sắc)
                          │
                          ▼
             [Top-K Đoạn trích chọn lọc]
                          │
                          ▼
              [Mô hình LLM Tạo câu trả lời]
```

1. **Truy xuất đa kênh (Multi-retrieval):** Đồng thời gửi truy vấn tới chỉ mục Vector (chụp ngữ nghĩa) và chỉ mục BM25/Splade (bắt từ khóa chính xác).
2. **Hợp nhất kết quả (Reciprocal Rank Fusion - RRF):** Sử dụng thuật toán RRF để gộp hai danh sách kết quả độc lập thành một danh sách ứng viên thống nhất mà không bị phụ thuộc vào thang điểm khác nhau của từng công cụ tìm kiếm.
3. **Tái xếp hạng (Reranking):** Sử dụng mô hình Cross-Encoder chuyên biệt (như Cohere Rerank, BGE-Reranker) để đọc cặp `(câu hỏi, đoạn văn)` và chấm điểm mức độ liên quan thực tế. Chỉ Top 3–5 đoạn có điểm cao nhất mới được đưa vào ngữ cảnh của LLM.

---

## 2. Ưu điểm và Thách thức trong Môi trường Doanh nghiệp

### Ưu điểm vượt trội:
- **Tri thức luôn tươi mới & Có thể kiểm toán (Attributable):** Cập nhật dữ liệu tức thì mà không cần tinh chỉnh trọng số mô hình.
- **Phân quyền dữ liệu chi tiết (Access Control Lists - ACL):** Dễ dàng gắn thẻ bảo mật cho từng đoạn dữ liệu, đảm bảo nhân viên chỉ truy xuất được các tài liệu thuộc phòng ban của mình.
- **Khả năng tiến hóa độc lập:** Đổi mô hình LLM sinh từ mà không cần lập chỉ mục lại toàn bộ cơ sở dữ liệu vector.

### Thách thức cần lưu ý:
- **Nguy cơ Prompt Injection gián tiếp:** Dữ liệu lấy từ các nguồn bên ngoài hoặc web có thể chứa các câu lệnh độc hại ẩn bên trong. Luôn cần có lớp bảo vệ (Guardrails) kiểm duyệt nội dung trước khi nạp vào LLM.
- **Độ phức tạp trong vận hành:** Bạn phải quản lý song song cả cơ sở dữ liệu vector và máy chủ tìm kiếm toàn văn (Elasticsearch/OpenSearch).
