인공지능에게 업무 지식을 가르치다 두 번이나 갈아엎은 이유와 해결책

인공지능에게 회사 내부의 복잡한 업무 도메인을 가르치기 위해 여러 방식을 시도하다가 결국 두 번이나 구조를 완전히 갈아엎는 시행착오를 겪었습니다. 사내에서 쓰이는 전문 용어와 고유한 업무 규칙을 일반 거대 언어 모델은 알지 못하기 때문에, 마치 숙련된 시니어 동료처럼 대화할 수 있는 맞춤형 인공지능을 직접 구축하고자 마음먹었습니다. 처음에는 문서 위키 패턴을 활용해 매일 작성되는 업무 관련 문서를 쌓아두고 대화에 활용하려 했으나 문서가 늘어날수록 토큰 비용이 폭증하고 핵심 정보를 놓치는 문제가 발생했습니다. 이러한 한계를 극복하기 위해 키워드 기반 색인 방식부터 본문 임베딩, 그리고 요약 임베딩과 키워드 검색을 결합한 혼합 방식까지 차례대로 도전하게 되었습니다. 실제 현업에서 마주쳤던 구체적인 문제 상황과 이를 해결하기 위해 방식을 전환했던 과정은 유사한 기술을 도입하려는 많은 개발자에게 큰 도움이 될 것입니다. 지금부터 어떤 시행착오를 거쳐 최적의 구조를 찾아내게 되었는지 그 생생한 이야기를 자세히 풀어보려고 합니다.

=

인공지능에게 업무 지식을 가르치다 두 번이나 갈아엎은 이유와 해결책

인공지능에게 업무 지식을 가르치다 두 번이나 갈아엎은 이유와 해결책

1. 도메인 지식을 인공지능에게 학습시키려던 초기의 배경

개발 설계를 하거나 새로운 업무 티켓을 만들 때 회사의 맥락을 잘 아는 시니어 개발자나 기획자와 상의할 수 있다면 작업 효율이 크게 높아집니다. 하지만 이러한 자리를 매번 마련하기란 현실적으로 어렵기 때문에, 만약 인공지능이 그 빈자리를 훌륭하게 채워줄 수 있다면 정말 이상적일 것이라고 생각했습니다. 세상에 널리 알려진 일반적인 거대 언어 모델은 우리 회사의 특수한 비즈니스 규칙이나 내부 용어를 전혀 이해하지 못하는 한계가 있습니다. 그래서 사내 업무 지식을 완벽하게 이해하고 있는 전용 시니어 인공지능 비서를 직접 만들어보기로 결심하고 프로젝트에 착수했습니다. 초기에 가져온 기발한 아이디어는 문서 위키 패턴을 활용하여 지식 창고를 구축하고 대화 모델이 이를 직접 읽으며 스스로 정리하게 만드는 방식이었습니다. 매일 업무용 소통 도구와 문서 관리 도구에서 진행 중인 과제와 관련 내용을 모아 마크다운 파일 형태로 차곡차곡 쌓아두었습니다. 처음에는 인공지능이 사내 맥락을 제법 잘 이해하고 답변을 내놓는 것처럼 보여서 이 방식이 완벽한 정답이라고 착각하기도 했습니다.

과제 관리와 설계 과정에서 시니어 동료의 부재를 인공지능으로 해결하려 했던 초기 기획 의도를 설명했습니다.

💡 핵심 포인트
일반 거대 언어 모델의 한계를 극복하고자 사내 도메인 지식을 주입하는 위키 기반의 초기 시도를 시작했습니다.

2. 문서가 쌓일수록 찾아오는 치명적인 성능 저하의 늪

지식 파일이 점점 쌓여감에 따라 매번 대화를 나눌 때마다 인공지능이 참고해야 하는 전체 문서의 양도 걷잡을 수 없이 불어났습니다. 처음에는 서른 개 정도이던 파일이 오십 개를 넘어가고 백 개에 육박하자, 토큰 사용 비용이 순식간에 폭증하는 무서운 현상이 발생했습니다. 비용 문제뿐만 아니라 입력되는 내용이 너무 길어지면 가운데에 위치한 중요한 정보를 인공지능이 제대로 인식하지 못하고 흘려버리는 현상까지 나타났습니다. 이로 인해 대화가 진행될수록 답변의 품질이 눈에 띄게 떨어졌고, 모든 문서를 무조건 한꺼번에 전달하는 방식에는 명백한 한계가 있다는 결론에 도달했습니다. 결국 발상을 완전히 바꾸어 모든 자료를 맹목적으로 보내는 대신, 대화의 맥락에 꼭 필요한 한두 개의 문서만 정확하게 찾아내어 전달하는 방식으로 선회해야만 했습니다. 이를 객관적으로 비교하기 위해 토큰 효율성, 필요한 정보를 놓치는 누락 비율, 전혀 관련 없는 문단이 끼어드는 참조 오류라는 세 가지 축을 기준으로 삼았습니다.

문서가 누적됨에 따라 발생하는 토큰 비용 폭증과 정보 누락 현상의 심각성을 분석했습니다.

💡 핵심 포인트
무조건 모든 문서를 입력하는 방식은 비용 폭증과 답변 품질 저하를 초래하여 검색 중심의 전환이 불가피했습니다.

3. 첫 번째 시도였던 키워드 색인 구조의 한계와 실상

가장 먼저 시도했던 구조는 마치 전통적인 검색 엔진을 시뮬레이션하는 것과 비슷한 키워드 기반의 색인 매핑 방식이었습니다. 키워드와 문서 경로를 라인 단위로 연결하고 첫 글자별로 분류된 버킷 파일에 새 문서가 생성될 때마다 인공지능이 직접 색인 라인을 추가하도록 만들었습니다. 예를 들어 특정 업무 용어와 관련된 단어가 등장하면 해당 키워드가 포함된 파일을 찾아 내용을 읽어 들인 뒤 대화 컨텍스트에 반영하는 흐름이었습니다. 하지만 며칠 동안 실제 운영을 해보니 정보가 누락되거나 엉뚱한 문서가 딸려오는 참담한 사례들이 연이어 쌓이기 시작했습니다. 첫 번째 문제는 동의어를 전혀 처리하지 못한다는 점이었는데, 사용자는 특정 브랜드명을 물어보았지만 색인에는 다른 단어로 등록되어 있어 검색 결과가 완전히 비어버렸습니다. 인공지능이 직접 색인을 작성하다 보니 학습 데이터에 존재하지 않는 사내 고유의 은어나 별칭을 스스로 유추할 방법이 없었던 것입니다.

키워드 기반의 색인 구조를 도입했던 방식과 운영 초기 발생한 동의어 처리의 한계를 설명했습니다.

💡 핵심 포인트
인공지능이 사내 은어와 동의어를 스스로 파악하지 못해 키워드 색인 방식은 정보 누락 문제를 유발했습니다.

4. 정확한 단어 일치가 불러온 무관한 문서 난입 문제

키워드 색인 구조에서 발생한 두 번째 문제는 정확한 단어 매칭 규칙 때문에 의도와 전혀 상관없는 다수의 문서가 한꺼번에 딸려오는 현상이었습니다. 비용 산정과 관련된 전문적인 질문을 던졌을 때, 질문에 포함된 단어가 들어있다는 이유만으로 운영 일정이나 계약 변경 이력 같은 무관한 문서들이 무더기로 후보에 올랐습니다. 단어의 의미나 문맥을 고려하지 않고 단순하게 글자 일치 여부만 따지다 보니 검색 의도와는 상관없는 일곱 개 이상의 문서가 동시에 불려 나갔습니다. 인공지능은 이 모든 문서를 전부 읽어 들인 뒤 그중에서 진짜 필요한 한 가지만 골라내고 나머지는 버리는 비효율적인 과정을 매번 반복해야 했습니다. 결국 매 대화마다 사용하지도 않을 무관한 문서들 때문에 원래보다 훨씬 많은 토큰 비용을 낭비하는 셈이 되었고 이는 참기 힘든 낭비였습니다. 이 경험을 통해 키워드 정확 매칭은 의미 매칭과 결코 같을 수 없으며, 색인을 직접 유지 관리하는 행위 자체가 거대한 기술 부채라는 뼈아픈 결론을 얻었습니다.

단어 일치 방식의 한계로 인해 무관한 문서가 대거 유입되어 토큰이 낭비되는 과정을 분석했습니다.

💡 핵심 포인트
키워드 정확 매칭은 문맥을 이해하지 못해 엉뚱한 문서를 대거 끌고 오며 결국 불필요한 비용 낭비로 이어졌습니다.

5. 의미 매칭으로의 전환과 요약 임베딩 분업화의 발견

키워드 방식의 실패를 교훈 삼아 본문 전체를 의미 기반의 벡터로 변환하여 유사도를 측정하는 방식으로 과감하게 방향을 틀었습니다. 단어의 단순 일치보다 문장의 전체적인 의미를 파악하는 것이 도메인 지식 검색에 훨씬 유리할 것이라는 판단에서 나온 시도였습니다. 그러나 본문 전체를 임베딩하는 방식 역시 문서의 양이 거대해지면 세부적인 키워드나 고유 명사를 정확하게 짚어내지 못하는 또 다른 약점을 드러냈습니다. 그리하여 최종적으로 도달한 결론은 문서의 핵심을 압축한 요약 정보에는 임베딩을 적용하여 전체적인 의미를 찾고, 실제 세부 검색에는 전통적인 키워드 검색을 함께 결합하는 혼합 방식이었습니다. 요약된 내용으로 넓은 범위를 빠르게 좁혀준 뒤 키워드 검색으로 정교하게 세부 문서를 솎아내는 분업 체계를 구축하자 성능이 극적으로 살아나기 시작했습니다. 이 혼합 방식을 적용한 이후부터는 토큰 비용이 안정화되었고 필요한 문서를 정확하게 찾아내는 비율도 비약적으로 상승하여 비로소 안정을 찾을 수 있었습니다.

임베딩 기술과 키워드 검색을 결합하여 두 번의 실패를 딛고 최적의 혼합 구조를 완성한 과정을 다뤘습니다.

💡 핵심 포인트
요약 임베딩으로 의미를 파악하고 키워드 검색으로 세밀함을 더하는 혼합 방식을 통해 마침내 최적의 효율을 달성했습니다.

6. 성공적인 도메인 학습 체계 구축을 위한 앞으로의 전망

인공지능에게 사내 전문 지식을 효과적으로 가르치는 일은 단순히 최신 기술을 무작정 도입한다고 해서 한 번에 해결될 수 있는 성질의 것이 아닙니다. 회사가 성장하고 업무 문서가 늘어남에 따라 지식을 관리하고 검색하는 구조 역시 유연하게 진화해야만 시스템이 지속 가능해집니다. 이번에 겪었던 두 번의 실패와 구조 개편 과정은 완벽한 단 하나의 정답보다는 현재의 데이터 규모와 상황에 맞는 적절한 조합을 찾는 것이 얼마나 중요한지 깨닫게 해 주었습니다. 앞으로도 새로운 업무 규칙이나 부서별 특수성이 늘어날 때마다 검색 혼합 방식을 더욱 정교하게 다듬어 나간다면 사내 동료처럼 든든한 조력자를 곁에 두는 효과를 누릴 수 있습니다. 인공지능 도입을 고민하는 많은 개발자와 기획자분들께서도 완벽한 초기 설계를 고집하기보다는 직접 부딪히며 시행착오를 겪고 구조를 개선해 나가는 용기를 가지시길 바랍니다. 끊임없는 개선과 집요한 문제 해결 과정이야말로 인공지능을 진정한 사내 전문가로 거듭나게 만드는 가장 확실하고 유일한 지름길이 될 것입니다.

도메인 지식 주입 과정의 경험을 바탕으로 향후 발전 방향과 독자들을 향한 조언을 정리했습니다.

💡 핵심 포인트
유연한 구조 개선과 상황에 맞는 기술 조합만이 인공지능을 진정한 사내 업무 전문가로 만드는 열쇠입니다.

자주 묻는 질문

인공지능에게 사내 도메인 지식을 가르칠 때 가장 먼저 부딪히는 문제는 무엇인가요?
문서가 쌓일수록 토큰 비용이 폭증하고 긴 문맥 속에서 중요한 정보를 놓치는 성능 저하 현상이 가장 먼저 발생합니다.
키워드 기반의 색인 방식이 실패했던 결정적인 이유는 무엇인가요?
인공지능이 사내 은어나 동의어를 스스로 파악하지 못해 정보가 누락되고, 단순 단어 일치로 인해 무관한 문서가 대거 불려 나왔기 때문입니다.
요약 임베딩과 키워드 검색을 결합한 혼합 방식은 어떤 장점이 있나요?
요약으로 전체적인 의미를 빠르게 파악하고 키워드로 세부 문서를 정교하게 찾아내어 토큰 비용과 정확도를 모두 잡을 수 있습니다.
사내 전용 인공지능 비서를 구축할 때 가장 명심해야 할 점은 무엇인가요?
완벽한 단일 구조를 한 번에 만들려 하기보다는 데이터 규모와 상황에 맞춰 구조를 유연하게 개선해 나가는 과정이 필수적입니다.

=