본문 바로가기
성공지식백과 로고성공지식백과
GLOSSARY

하이브리드 검색 (Hybrid Search)

중급AI 에이전트

이 페이지는 AI 에이전트 문맥에서 자주 쓰이는 하이브리드 검색 (Hybrid Search)의 뜻과 쓰임을 중급 난이도 기준으로 정리한 AI 용어사전 항목입니다. 정의와 맥락, 관련 용어 9개 순서로 묶었으니, 아래 설명을 먼저 읽고 연결된 개념과 글까지 이어서 보면 이해가 빨라집니다.

하이브리드 검색(Hybrid Search)은 키워드가 정확히 맞는 문서를 찾는 어휘 검색과 뜻이 가까운 문서를 찾는 벡터 검색을 함께 실행해 두 결과를 하나의 순위로 합치는 방식입니다. 제품 코드와 고유명사는 어휘 검색이, 표현이 다른 같은 의도는 벡터 검색이 잘 찾는다는 상호 보완 관계를 이용합니다.

두 검색을 함께 실행하는 이유

어휘 검색은 문서에 실제로 등장한 단어와 질의의 일치를 계산합니다. BM25 같은 방식은 희귀한 단어와 문서 내 출현 빈도 등을 사용해 관련도를 정합니다. XR-2200, 오류 코드 E401, 사람 이름처럼 철자 자체가 중요한 질의에 강합니다. 하지만 사용자가 “결제가 거절됐다”고 쓰고 문서에는 “카드 승인 실패”만 있다면 같은 뜻을 놓칠 수 있습니다.

벡터 검색은 질의와 문서를 임베딩으로 바꾸고 가까운 표현을 찾습니다. 단어가 일치하지 않아도 의미가 비슷한 문서를 가져올 수 있지만, 비슷하게 생긴 식별자를 정확히 구분하거나 희귀한 이름을 찾는 능력은 임베딩 모델과 데이터에 따라 달라집니다. Elastic의 하이브리드 검색 설명은 어휘 검색과 의미 검색을 함께 사용해 두 검색의 장점을 결합하는 구조를 소개합니다.

실행 흐름은 보통 한 질의를 어휘 검색과 벡터 검색에 보내 각각 순위 목록을 얻고, 이를 합쳐 최종 후보를 만드는 형태입니다. Microsoft의 Azure AI Search 문서는 텍스트 질의와 벡터 질의를 병렬로 실행한 뒤 하나의 결과 집합으로 융합하는 사례를 설명합니다. 구현에 따라 두 검색을 물리적으로 동시에 처리하지 않을 수도 있으므로, 병렬 실행은 흔한 구성이지 용어의 필수 조건으로 볼 필요는 없습니다.

메타데이터 필터는 별도의 정확 조건을 맡습니다. “2026년 이후 인사 규정”이라면 연도와 문서 종류를 필터로 제한하고, 남은 문서에서 어휘·벡터 검색을 수행할 수 있습니다. Microsoft의 필터 문서는 키워드 검색과 벡터 검색에서 값 기반 포함·제외 조건을 적용하는 위치가 다를 수 있다고 설명합니다. 필터를 너무 일찍 좁히면 관련 문서를 잃고, 너무 늦게 적용하면 불필요한 후보 계산이 늘어납니다.

점수가 다른 결과를 어떻게 합치는가

어휘 점수와 벡터 유사도는 계산법과 범위가 다릅니다. 숫자를 그대로 더하면 값의 범위가 큰 검색이 최종 순위를 사실상 지배할 수 있습니다. 대표적인 결합법인 RRF(Reciprocal Rank Fusion)는 원래 점수 대신 각 목록의 등수를 사용합니다. 두 목록에서 모두 상위에 있거나 어느 한쪽에서 매우 높은 문서가 올라오며, 점수 척도를 맞추지 않아도 적용할 수 있습니다.

가중 합산은 각 검색의 점수를 정규화한 뒤 중요도에 따라 가중치를 곱해 더합니다. 제품명 검색이 많은 지원 센터라면 어휘 검색 비중을 높이고, 자연어 질문이 많은 지식 검색이라면 벡터 검색 비중을 높이는 실험을 할 수 있습니다. Elastic의 선형 결합 문서는 min-max 같은 정규화와 검색별 가중치를 함께 설정하는 예를 제공합니다. 정규화 방식과 가중치는 실제 질의 표본으로 조정해야 하며, 한 환경의 값을 그대로 옮기면 같은 결과를 기대하기 어렵습니다.

ℹ️검색 점수를 바로 더하지 않습니다

BM25 점수와 벡터 유사도는 같은 척도가 아닙니다. 등수만 쓰는 RRF를 적용하거나, 점수를 정규화한 뒤 검증된 가중치로 합칩니다.

합칠 후보 수는 품질과 지연을 함께 바꿉니다. 각 검색에서 너무 적게 가져오면 한쪽이 찾아낸 유용한 문서가 결합 전에 잘릴 수 있습니다. 후보를 늘리면 재현율을 높일 여지가 있지만 순위 융합, 후속 리랭킹, 네트워크 전송의 비용도 커집니다. 검색별 후보 수, 최종 반환 수, 리랭킹에 넘길 수를 따로 두고 측정하는 편이 좋습니다.

언제 효과가 있고 언제 줄여야 하는가

예를 들어 사내 장비 문서에서 “노트북 와이파이가 자꾸 끊긴다”를 검색한다고 가정해 보겠습니다. 벡터 검색은 “무선 연결 불안정 해결” 문서를 찾고, 어휘 검색은 질의에 모델 번호가 함께 있을 때 정확한 장비 문서를 올릴 수 있습니다. 합친 결과에 제품군과 문서 상태 필터를 적용하면 폐기된 설명서를 제외할 수 있습니다. 이후 더 정교한 관련도 판단이 필요하면 상위 후보만 리랭킹 단계에 보냅니다.

하이브리드 검색이 항상 단일 검색보다 좋은 것은 아닙니다. 문서가 짧은 식별자 목록이고 질의도 정확한 코드뿐이라면 벡터 검색이 잡음을 보탤 수 있습니다. 반대로 데이터에 키워드 필드가 거의 없고 자연어 의미 검색만 중요하다면 어휘 검색의 기여가 작을 수 있습니다. 두 검색 중 하나의 품질이 낮은데 같은 비중으로 합치면 단일 검색의 좋은 순위를 훼손할 수도 있습니다.

도입 전에는 실제 질문과 정답 문서가 묶인 평가 세트를 준비합니다. 어휘 검색, 벡터 검색, RRF, 정규화 가중 합산을 같은 후보 수에서 비교하고 Recall@k, MRR, NDCG 같은 검색 지표와 지연을 함께 봅니다. 필터 조건이 있는 질문과 식별자, 고유명사, 동의어 질문을 따로 분석하면 어느 검색이 무엇을 보완하는지 알 수 있습니다. 개선이 확인되지 않으면 결합 방식을 복잡하게 만들기보다 인덱스 필드, 임베딩, 청크 경계와 질의 자체를 먼저 점검해야 합니다.

RELATED TERMS

관련 용어

하이브리드 검색 (Hybrid Search)와 함께 자주 언급되는 개념들입니다. 비슷한 말처럼 보여도 역할과 쓰임은 다를 수 있습니다.