프롬프트 엔지니어링 논문임..
Background
소속: Microsoft, Scale AI
게재: 아카이브
Abstract & 1 INTRODUCTIONㄱ
✔️ 기존의 RAG
- 추가적인 명시적 기준 없이 문맥 관련성을 극대화하려는 검색 시스템은 정보 병목 현상이 발생해 답변 품질이 저하됨
- 통합 메트릭을 고려할 때 추론 시간 컴퓨팅 사용량에 따라 제대로 확장되지 않음
✔️ RErank BEyond reLevance (REBEL)
- Chain-of-Thought prompting (and optionally Multi-Turn dialogue)를 사용하여 multi-criteria optimization를 주입함으로써 RAG 시스템이 추론 시간 컴퓨팅에 따라 확장할 수 있도록 함
- 새로운 성능/속도 트레이드오프 곡선을 가능하게 하여 RAG 시스템이 검색된 컨텍스트의 관련성을 높이고 추론 시간이 증가함에 따라 우수한 답변 품질을 모두 달성
✔️ Contributions
- Single-Criterion Relevance/Answer Quality Tradeoff Demonstration: 연관성만을 최적화하는 방법이 검색 정확도를 높이는 동시에 답변 품질을 크게 떨어뜨린다는 사실을 입증
- One-Turn Multi-Criteria Reranking: one-turn multi-criteria LLM reranking prompt가 관련성/품질 트레이드오프를 극복하는 것을 보여줌. 검색된 문맥의 관련성과 답변의 유사성을 모두 향상
- Two-Turn Multi-Criteria Strategy: 쿼리 종속 기준을 동적으로 추론하여 추론 속도를 높이는 대신 최고의 답변 품질과 문맥 관련성을 제공
- New Inference-Time-Compute/Quality Tradeoff Curve In RAG Systems: 우리가 제안하는 방법은 새로운 트레이드오프 곡선을 가능하게 하며, 이제 추론 속도와 문맥 관련성 증가 및 답변 품질 향상으로 측정되는 전반적인 시스템 품질 사이에 균형이 존재
2 OUR METHOD
REBEL은 재랭크 프로세스에 연쇄 사고 프롬프트를 통합하는 두 가지 보완적인 접근 방식을 도입
- one-turn multi-criteria reranking prompt: 기존의 관련성/품질 트레이드오프를 무시하기 위해 관련성(relevance) 외에 품질까지 측정
- dynamic two-turn strategy: 쿼리별 기준을 추론하여 개별 쿼리에 맞게 조정
2.1 ONE-TURN MULTI-CRITERIA STRATEGY
단순한 주제 관련성 외에도 LLM 프롬프트로 사전 정의된 2차 기준에 따라 문서를 평가하고 순위를 다시 매김
1. Secondary Criteria Evaluation
- Depth of Content: 주제에 대한 철저함과 포괄적인 범위를 측정합니다.
- A "5" is exceptionally in-depth with multiple facets addressed; a "0" is very superficial.
- Diversity of Perspectives: 다양한 관점 또는 각도의 표현을 평가합니다.
- A "5" means it engages with a variety of perspectives or sources; a "0" means it is entirely one-sided.
- Clarity and Specificity: 문서가 얼마나 명확하고 정확하게 정보를 제시하고 질의에 대응하는지 평가합니다.
- A "5" means it is highly specific and clear, while a "0" means it is vague or overly general.
- Authoritativeness: 출처의 신뢰성과 전문성을 측정합니다.
- A "5" might be an extensively cited academic work or an official standard; a "0" would be an unknown or dubious source.
- Recency: 시간적 관련성을 평가합니다.
- A "5" means it is very current and up-to-date; a "0" means it is outdated or does not reference any time-sensitive information.
2. Comprehensive Scoring Rubric
- Relevance scores(0~10점)는 주제 정렬을 평가합니다.
- Secondary criteria scores(0~5점)는 각 추가 속성을 평가합니다.
3. Weighted Composite Score
$$ \text{Final Score} = \text{Relevance} + \sum_{i} w_i \times (\text{Property}_i) $$
- $w_i$: the weight for each secondary criterion
4. Chain-of-Thought Process
(a) 문서 콘텐츠를 철저히 분석하기
(b) 각 보조 속성에 대해 독립적으로 점수 부여하기
(c) 가중된 종합 점수 계산하기
(d) 가중된 종합 점수를 기준으로 문서 정렬 및 필터링하기
5. Strict Output Format
이 프롬프트는 기존 LLM 리랭커 형식과 일치하는 일관된 리랭크 출력 구조를 적용합니다.
2.2 TWO-TURN MULTI-CRITERIA STRATEGY
각 쿼리에 대한 재순위 기준을 조정
1. Query-Dependent Reranking Prompt Generation
시스템은 먼저 chain-of-thought(연쇄 사고)를 통해 사용자 쿼리와 관련된 보조 기준을 추론하고 순위 재지정 프롬프트를 개발
(a) 쿼리 의도 및 요구 사항 분석
(b) 가장 적절한 보조 기준을 식별하고 그 정의를 자세히 명시합니다.
(c) 각 보조 기준에 대한 적절한 가중치 체계 지정하기
(d) 가중치가 적용된 종합 점수 정의하기
(e) 재랭킹 LLM에 가중치가 부여된 종합 점수를 기준으로 문서를 정렬 및 필터링하도록 지시하고, 출력은 기존의 LLM 재랭킹 출력 형식을 준수하도록 합니다.
2. Reranking
재랭크 LLM은 문서 세트와 함께 생성된 쿼리 종속 재랭크 프롬프트를 입력으로 받아 이러한 문서에 대한 순서를 생성합니다.