CS

[논문 리뷰] MiniRAG: Towards Extremely Simple Retrieval-Augmented Generation (2025), RAG(7)

yoooon1009 2025. 5. 19. 17:27

Backgorund

소속: University of Hong Kong

게재: 아카이브

ABSTRACT & 1 INTRODUCTION

✔️ 현재의 Small Language Models (SLMs)

  • 현재의 RAG 아키텍처들은 LLM에 최적화되어 있음 
  • SLM처리하기에는 복잡한 쿼리 해석, 추론, 의미 매칭, 정보 종합 등의 기능을 제대로 수행하지 못함
  • 정확도가 떨어지는 성능 저하 발생
  • LLM에서 SLM으로 전환할 때 특정 고급 RAG 프레임워크가 작동하지 않음

✔️ SLM에 대한 세 가지 근본적인 관찰(인사이트)

  • 정교한 의미 이해에는 어려움을 겪지만 패턴 매칭과 지역화된 텍스트 처리에는 탁월함
  • 명시적인 구조 정보는 제한된 의미 기능을 효과적으로 보완할 수 있음
  • 복잡한 RAG 연산을 더 간단하고 잘 정의된 단계로 분해하면 고급 추론 기능 없이도 시스템의 견고성을 유지할 수 있음

=> 의미론적 복잡성보다 구조적 지식 표현을 우선시함

 

✔️Mini RAG

SLM에 대한 인사이트를 활용하고, 극도의 단순성과 계신 효율성에 중점을 두고 정보 검색 및 생성 파이프라인을 재구성

  1. a semanticaware heterogeneous graph indexing mechanism: 텍스트 청크와 명명된 엔티티를 체계적으로 결합해 복잡한 의미 이해에 대한 의존도를 줄임
  2. a lightweight topology-enhanced retrieval approach: 효율적인 지식 검색을 위해 그래프 구조와 휴리스틱 검색 패턴을 활용
더보기

Heterogeneous Graph란, 서로 다른 종류의 노드 엣지존재하는 복잡한 구조의 그래프입니다.

✔️ 성능

  • 기존의 경량 RAG 시스템과 비교했을 때 MiniRAG는 25%의 저장 공간만 사용하면서 1.3~2.5배 높은 효율성을 달성
  • LLM에서 SLM으로 전환할 때에도 다양한 시나리오에서 정확도 감소가 0.8%에서 20%에 불과할 정도로 뛰어난 견고성을 유지
  • 에지 디바이스나 개인정보 보호에 민감한 애플리케이션과 같이 리소스가 제한된 환경에 적합한 lightweight footprint 유지
더보기

footprint: 일반적으로 자원의 소비량이나 영향 범위의미하는 용어

lightweight footprint: 자사용을 최소화하여, 제한된 환경에서도 효율적으로 동작할 있도록 설계된 시스템

2 THE MINIRAG FRAMEWORK

Mini RAG는 두 요소로 구성됨

  1. heterogeneous graph indexing, which creates a semantic-aware knowledge representation
  2. lightweight graph-based knowledge retrieval, which enables efficient and accurate information retrieval

2.1 HETEROGENEOUS GRAPH INDEXING WITH SMALL LANGUAGE MODELS

✔️ Small Language Models (SLMs)의 제약

  • 원시 텍스트 코퍼스에서 복잡한 개체 관계와 미묘한 문맥적 연결을 추출하고 이해하는 능력의 저하
  • 대량의 텍스트를 효과적으로 요약하는 능력 저하
  • 노이즈(관련 없는 콘텐츠를 포함하는 검색된 정보  등)를 처리하는 능력의 저하

✔️ Mini RAG의 목표

  • 이해와 요약 능력이 떨어지더라도 데이터 내의 주요 관계와 문맥적 연결을 추출
  • 검색된 콘텐츠를 질문과 가장 관련 있는 핵심 요소들로 압축 => 혼란을 있는 정보나 오해의 소지가 있는 정보최소화

✔️ Semantic-Aware Heterogeneous Graph

원시 텍스트에서 추출한 텍스트 청크와 명명된 엔티티를 모두 체계적으로 통합하여 정확한 정보 검색을 용이하게 하는 풍부한 의미 네트워크(semantic network)를 생성

  • 노드: 제한된 요약 능력인해 발생할 수 있는 정보 왜곡을 완화할 수 있음 
    • Text Chunk Node $\mathcal{V}_c$: 문맥을 유지하는 원본 텍스트 세그먼트
    • Entity Node $\mathcal{V}_e$: 텍스트 청크에서 추출된 주요 의미적 요소들. 이벤트, 지역, 시간, 의미를 이해시켜주는 특정 분야에 특화된 개념들("고혈압", "주식", "프로토콜" 등)
  • 엣지
    • Entity-Entity Connections $\mathcal{E}_{\alpha}$: sematic relationships, hierarchical structures, temporal or spatial dependencies 등 엔티티와 엔티티 사이의 관계들
    • Entity-Chunk Connections $\mathcal{E}_{\beta}$: 엔티티를 추출한 원본 텍스트와 엔티티를 연결하기 위한 엣지. 문맥적 관련성과 의미적 일관성 유지.
    • text-attributed connection $(e_{\beta}, d_{e_{\beta}}) \in \mathcal{E}_{\beta}$: entity-chunk connection $e_{\beta}$에 대한 보충 정보로 언어 모델로 생성한 entity에 대한 설명. 연결된 노드 간에 명시적인 관계 컨텍스트를 제공하여 엣지를 향상함

$$ \mathcal{D} = \mathcal{G} = (\{ \mathcal{V}_c, \mathcal{V}_e \}, \{ \mathcal{E}_{\alpha}, (e_{\beta}, d_{e_{\beta}}) \in \mathcal{E}_{\beta} \})$$

2.2 LIGHTWEIGHT GRAPH-BASED KNOWLEDGE RETRIEVAL

LLM에서 SLM으로 전환하기 위해

  • 생성할 입력 콘텐츠의 복잡성을 줄여 의미 정보를 명확하고 간결하게 구성
  • 입력 콘텐츠 길이를 단축
  • 그래프 기반 검색 설계를 채택함으로써 대규모 언어 모델에 대한 정확한 의미론적 매칭에 대한 부담을 덜어주는 것이 목표

2.2.1 QUERY SEMANTIC MAPPING

최적의 답변 생성을 위한 그래프 경로를 찾기 위해 정의된 노드들

 

*쿼리로부터..

  • 쿼리 엔티티 $\mathcal{V}_q$: SLM으로 쿼리로부터 생성
  • 쿼리 답변 유형: 이벤트, 위치, 사람 등 쿼리 답변의 잠재적 유형. SLM을 활용해 쿼리로부터 생성

*쿼리를 기반으로 지식 그래프로부터..

  • Initial Entity Identification $ \hat{\mathcal{V}}_s$: 쿼리 엔티티와 높은 유사도를 갖는 엔티티 노드들. 경로 탐색을 위한 시작점.
  • Answer-Aware Entity Selection $ \hat{\mathcal{V}}_a $: 쿼리 답변 유형과 관련되어 검색된 답변 후보 노드들(candidate answer nodes) 선택
  • Context-Rich Path Formation $ \hat{\mathcal{V}}_c $: 쿼리와 관련되어 검색된 텍스트 청크 노드들

2.2.2 TOPOLOGY-ENHANCED GRAPH RETRIEVAL

0. 최적의 답변 생성을 위한 인덱싱한 지식 그래프 내에서 최적의 추론 경로를 정의하기

 

1. 시작 후보 노드 와 답변 후보 노드를 연결하는 최단 경로의 엣지를 파악. 그 다음 각 엣지에 대해서 관련성 점수 계산  key relationships 구성

2. 시작 후보 노드에서 시작해 길이 n인 모든 비순환 경로들 파악. 그 다음 1에서 계산한 엣지의 관련성 점수, 비순환 경로 내에 존재하는 노드가 답변 후보 노드에 포함되는지 여부, 쿼리 엔티티와 시작 후보 노드의 유사성을 고려해 해당 경로의 점수를 계산하여 추론 경로의 최종 집합을 구성

3. 2번에서 구성된 추론 경로에 존재하는 엔티티와 청크 노드 수집. 수집된 노드가 쿼리와 관련된 청크 노드이면 후보에 추가. 후보 청크 노드와 입력 쿼리와의 유사성을 계산하고, 순위를 매겨 추론을 돕기 위한 검색된 텍스트 청크 노드 집합으로 선택.

 

4. 시작 후보 노드들 + 1에서 찾은 중요한 엣지들 + 3에서 찾은 정답 생성에 필요한 텍스트 청크 노드 집합을 기반으로 최종 답변 생성

 

Key Relationship Identification

1. 시작 후보 노드 $\hat{v}_s \in \hat{\mathcal{V}}_s$와 답변 후보 노드 $\hat{v}_a \in \hat{\mathcal{V}}_a$ 를 연결하는 최단 경로의 엣지 $e \in \mathcal{E}_{\alpha}$를 파악. 그 다음 각 엣지에 대해서 관련성 점수 $w_e(e)$ 계산하여, 상위 점수를 가진  key relationships 구성 $\hat{\mathcal{E}}_{\alpha}$

$$  w_e(e)=\sum_{ \hat{v}_s \in \hat{\mathcal{V}}_s} \operatorname{count} (\hat{v}_s, \hat{\mathcal{G}}_{e, k}) + \sum_{ \hat{v}_a \in \hat{\mathcal{V}}_a} \operatorname{count} ( \hat{v}_a, \hat{\mathcal{G}}_{e, k} )$$

  • $\hat{\mathcal{G}}_{e, k}$: 중심 엣지 $e$를 기준으로 $k$단계 이내 도달 가능한 모든 노드와 엣지를 포함하는 그래프

Query-Guided Path Discovery

2. 시작 후보 노드 $\hat{v}_s \in \hat{\mathcal{V}}_s$에서 시작해 길이 n인 모든 비순환 경로 집합 $\mathcal{P}_{\hat{v}_s}$ 파악. 그 다음 1에서 계산한 엣지의 관련성 점수 $w_e(e)$, 비순환 경로 내에 존재하는 노드가 답변 후보 노드에 포함되는지 여부$\operatorname{count}(v, p)$, 쿼리 엔티티와 시작 후보 노드의 유사성$w_v(\hat{v}_s \mid v_q)$을 고려해 해당 경로의 점수를 계산하여 추론 경로의 최종 집합 $\mathcal{P}_q$을 구성

$$ w_p(p \mid v_q) = w_v(\hat{v}_s \mid v_q) \cdot ( 1+ \sum_{v \in (p \land \hat{\mathcal{V}}_a) } \operatorname{count}(v, p) + \sum_{ e \in (p \land \hat{\mathcal{E}}_{\alpha}) } w_e(e))$$

  • $ w_v(\hat{v}_s \mid v_q) $: 임베딩 벡터를 기반으로 코사인 유사도를 계산하여 구함
  • $ \operatorname{count}(v, p) $: 경로 $p$에 노드$v$가 있으면 1, 아니면 0.

Retrieval of Query-Relevant Text Chunks

3.

  • 2번에서 구성된 추론 경로 $\mathcal{P}_q$에 존재하는 엔티티와 청크 노드 $\mathcal{V}_c^q$ 수집.
  • 수집된 노드가 쿼리와 관련된 청크 노드이면 후보에 추가$ \hat{\mathcal{V}}_c \land \mathcal{V}_c^q $.
  • 후보 청크 노드와 입력 쿼리와의 유사성을 계산하고,
  • 순위를 매겨 추론을 돕기 위한 검색된 텍스트 청크 노드 집합 $\hat{\mathcal{V}}_c^q$으로 선택.

 

Integration for Augmented Generation

4.

  • 시작 후보 노드들 $ \hat{\mathcal{V}}_a$과
  • 1에서 찾은 중요한 엣지들 $\hat{\mathcal{E}}_{\alpha}$과
  • 3에서 찾은 정답 생성에 필요한 텍스트 청크 노드 집합$ \hat{\mathcal{V}}_c^q $을

기반으로 최종 답변 생성

3 EVALUATION

이번 평가는 세 가지 주요 연구 질문(RQ)를 다룬다:

  • RQ1: Comparative Performance. How does MiniRAG perform against state-of-the-art alternatives in terms of retrieval accuracy and efficiency?
  • RQ2: Component Analysis. What is the contribution of key components to MiniRAG’s overall effectiveness?
  • RQ3: Case Studies. How effectively does MiniRAG handle complex, multi-step reasoning tasks with small language models, as demonstrated through practical case studies?

3.2 PERFORMANCE ANALYSIS (RQ1)

Performance Degradation in Existing RAG Systems with SLMs

  • LightRAG’s accuracy plummeting from 56.90% to 35.42% during LLM to SLM transition
  • GraphRAG experiences complete system failure
  • 기존 시스템은 정교한 언어 기능에 과도하게 의존해 단순한 모델을 사용할 때 운영 장애로 이어짐. 리소스 제약 환경에서 제약사항이 될 수 있음.

 

MiniRAG’s Unique Advantages

 

i) Semantic-Aware Graph Indexing for Reduced Model Dependency

MiniRAG의 dual-node heterogeneous graph structure는 강력한 텍스트 생성 기능에 의존하는 대신 기본적인 엔티티 추출과 이기종 관계 매핑에 중점을 둡니다. 이 설계는 원시 문맥 정보를 보존하기 위한 텍스트 청크 노드와 주요 의미 요소를 캡처하기 위한 엔티티 노드를 결합하여 제한된 언어 모델 기능으로도 효과적인 강력한 지식 표현을 생성합니다.

 

ii) Topology-Enhanced Retrieval for Balanced Performance.

쿼리 중심의 경로 검색으로 시작하여 임베딩 기반 매칭과 구조적 그래프 패턴 및 엔티티별 관련성 점수를 통합합니다. 토폴로지 인식 검색과 최적화된 효율성을 통해 고급 언어 이해 없이도 강력한 검색 품질을 달성할 수 있어 온디바이스 배포에 특히 효과적입니다.

 

Storage Efficiency While Maintaining Performance

MiniRAG는 높은 정확도 수준을 유지하면서 탁월한 스토리지 효율성을 보여줍니다. 경험적 평가에 따르면 MiniRAG는 gpt-4o-mini가 포함된 LightRAG와 같은 기준선에 비해 25%의 스토리지 공간만 필요로 하면서도 경쟁력 있는 정확도를 달성하는 것으로 나타났습니다. 

3.3 COMPONENT-WISE ANALYSIS OF MINIRAG (RQ2)

  • Validating SLM Limitations: 간소화된 색인 방법을 텍스트 의미 중심 색인 기법(-I)으로 대체했을 때 상당한 성능 저하를 초래
  • Effectiveness of Query-guided Reasoning Path Discovery: 에지 정보 $\mathcal{R}_{chunk}$ 또는 청크 노드$\mathcal{R}_{edge}$의 제거가 시스템 성능에 큰 영향을 미친다는 사실을 입증

  • $- \mathcal{I}$: heterogeneous indexing graph에서 의미 기반의 인덱싱 그래프로의 변경
  • $- \mathcal{R}_i$: 특정 모듈 $i$을 제거함

3.4 CASE STUDY ANALYSIS (RQ3)

한계점에 대해 논의할 줄 알았는데 비교 성능 자랑만 함

5 CONCLUSION

MiniRAG

 

Through its innovative heterogeneous graph indexing and lightweight heuristic retrieval mechanisms, 

 

MiniRAG effectively integrates the advantages of both text-based and graph-based RAG approaches while significantly reducing the demands on language model capabilities.

반응형