기업 내 AI 활용은 빠르게 일상적인 업무 환경으로 들어오고 있습니다. Deloitte의 2026 State of AI in the Enterprise에 따르면, 기업들은 2025년 한 해 동안 직원의 AI 접근 권한을 50% 확대했으며, 승인된 AI 도구를 사용할 수 있는 직원 비중은 40% 미만에서 약 60%까지 증가했습니다. 또한 조사 기업의 85%는 자사 업무에 맞게 AI 에이전트를 커스터마이징할 것으로 예상했습니다. 이는 AI가 더 넓은 조직 단위의 업무 인프라로 확산되고 있음을 보여줍니다.
AI의 사용 범위가 넓어질수록 기업이 마주하는 질문도 구체화됩니다. 수천 명에서 수십만 명의 임직원이 매일 AI를 활용하는 환경에서는 개별 사용자의 작은 LLM 호출도 조직 전체의 운영 비용으로 누적됩니다. 특히 AI 에이전트가 여러 도구를 호출하고, 컨텍스트를 반복적으로 참조하고, 유사한 요청을 계속 처리하는 구조에서는 비용을 예측하고 통제하는 일이 중요한 운영 과제가 됩니다.
Gartner는 2026년 발표에서 agentic workflow의 AI inference 비용이 2028년까지 5배 이상 증가할 수 있다고 전망했습니다. 에이전트형 워크플로우가 더 긴 추론, 더 많은 tool call(도구 호출), 더 큰 컨텍스트를 사용하면서 워크플로우 단위 비용이 커질 수 있다는 분석입니다.
엔터프라이즈 환경에서 LLM 비용 최적화 논의가 중요해지는 이유도 여기에 있습니다. 최근 Uber Engineering은 2월부터 8월까지 agentic tool의 주간 활성 사용자가 7배, 주간 agentic request가 9.4배 증가했지만, 전체 AI 지출은 4월 이후 비교적 안정화되었다고 설명했습니다. 사용량이 빠르게 늘어나는 상황에서도 비용을 통제하려면 token 사용량, 모델 요청 수, 세션당 비용, 도구 호출 구조를 함께 관리해야 한다는 점을 보여주는 사례입니다.
엔터프라이즈 환경에서 LLM 비용 최적화 논의는 이미 시작되고 있습니다. 기업용 AI 챗봇과 AI 에이전트의 비용은 모델 가격표만으로 설명되기 어렵습니다. 사용자가 한 번 질문했을 때 AI가 몇 번의 추론을 반복하는지, 어떤 도구를 몇 번 호출하는지, 매번 얼마나 긴 업무 맥락을 함께 전달하는지에 따라 최종 비용이 달라집니다. 고객 정보, 상품 구조, 주문 상태, 계약 조건, 가격 정책, 재고 현황, 내부 예외 규칙이 함께 연결되는 엔터프라이즈 환경에서는 이 차이가 더 선명하게 드러납니다.
반복 호출이 예기치 못한 LLM 비용 증가를 만드는 이유
AI 에이전트가 여러 단계의 업무를 처리할 때, 이전 단계의 대화와 조회 결과가 그대로 다음 단계에 이어진다고 보기 어렵습니다. 다음 판단을 이어가기 위해서는 앞선 대화, 도구 호출 결과, 참고 문서, 판단 근거가 다시 입력으로 전달되어야 합니다. 예를 들면, 회의에서 발언할 때마다 이전 회의록을 다시 읽고 발언을 시작하는 상황에 비유할 수 있으며, 열 번째 발언에서는 앞선 아홉 번의 맥락이 다시 전달됩니다.
이러한 상황에서는 초반에 입력된 큰 문서나 조회 결과가 이후 호출에도 계속 영향을 줍니다. 호출이 이어질수록 같은 정보가 반복적으로 입력 비용에 반영됩니다. 초반에 전달된 큰 문서, 긴 조회 결과, 상세한 업무 맥락은 남은 호출 수만큼 다시 실리기 때문에, 실제 비용은 해당 정보의 크기와 이후 반복 호출 수가 함께 만든다고 볼 수 있습니다. 사용자가 보기에는 하나의 질문과 하나의 답변처럼 보여도, 내부적으로는 여러 번의 모델 호출, 도구 실행, 중간 결과 해석, 컨텍스트 재전송이 이어질 수 있습니다.

위 그래프는 어떤 변수가 비용을 키우는지를 단순화하여 표현했습니다. 여기서 ‘a’는 매 호출마다 반복되는 기본 입력입니다. 시스템 프롬프트, 도구 설명, 사용자 요청처럼 AI 에이전트가 작업을 시작할 때마다 함께 전달되는 내용입니다. ‘k’는 호출이 이어질수록 새로 쌓이는 컨텍스트입니다. 도구 호출 결과, 조회 결과, 중간 추론, 대화 기록처럼 다음 호출에 다시 반영되는 정보입니다. ‘n’은 답에 도달하기까지의 호출 수입니다.
기본 입력은 호출 수에 따라 비교적 예측 가능한 방식으로 늘어납니다. 반면 누적 컨텍스트는 호출이 길어질수록 다음 호출에 다시 포함되는 양이 커집니다. 에이전트가 12번의 탐색과 검증을 거쳐 답에 도달하는 구조와 4번의 호출 안에서 필요한 정보를 찾는 구조는 비용 곡선 자체가 달라집니다. 누적 컨텍스트 관점에서는 호출 수를 줄이는 설계가 전체 비용에 큰 차이를 만듭니다.
이 때문에 엔터프라이즈 AI 에이전트의 비용 관리는 프롬프트 길이, 반복 호출, 누적 컨텍스트를 함께 보는 방식으로 설계되어야 합니다. 어떤 업무에서 어떤 컨텍스트가 반복적으로 실리는지, 어떤 도구 호출이 중복되는지, 어떤 질문이 긴 loop로 이어지는지 확인할 수 있어야 합니다. 비용이 쌓이는 지점을 알아야 비용을 통제할 수 있습니다.
토큰 사용량을 줄이는 세 가지 변수

표에서 보듯 세 변수는 각각 다른 방식으로 비용에 영향을 줍니다. 기본 입력은 매 호출마다 반복되기 때문에, 입력 구조를 정리할수록 안정적으로 줄어듭니다. 누적 컨텍스트는 호출이 길어질수록 다음 호출에 다시 포함되는 양이 커지므로, 조회 결과와 중간 판단을 그대로 쌓아두지 않는 관리 기준이 필요합니다. 호출 수는 입력 비용과 출력 비용에 동시에 영향을 주기 때문에, AI 에이전트가 답에 도달하는 경로를 짧게 만드는 설계와 직접 연결됩니다.
따라서 LLM 비용 최적화는 이 세 변수를 분리해 관찰하는 것에서 시작됩니다. 어떤 비용이 기본 입력에서 발생하는지, 어떤 비용이 누적 컨텍스트에서 발생하는지, 어떤 비용이 반복 호출에서 발생하는지 확인해야 최적화의 우선순위를 정할 수 있습니다.
반복 입력과 누적 컨텍스트를 관리하는 운영 기준
반복 입력을 관리하려면 시스템 프롬프트와 도구 설명서부터 점검해야 합니다. 매 호출마다 전달되는 내용은 짧고 명확해야 하며, 도구 설명은 에이전트가 사용 조건을 판단할 수 있을 만큼 구체적이어야 합니다. 도구 설명이 명확해지면 잘못된 도구 호출이 줄어들고, 결과적으로 불필요한 호출과 비용도 함께 줄어들 수 있습니다.
이 영역의 효과는 실행 환경에 따라 달라집니다. 프롬프트 캐싱이 안정적으로 적용되는 구조에서는 매번 반복되는 기본 입력의 비용 부담이 낮아질 수 있습니다. 반대로 캐싱이 자주 깨지거나, 사용자별 권한과 업무 조건에 따라 프롬프트 구성이 자주 달라지는 환경에서는 반복 입력이 중요한 비용 요인이 됩니다.
누적 컨텍스트에는 별도의 관리 기준이 필요합니다. 큰 조회 결과가 대화에 그대로 남으면 이후 호출마다 다시 전송됩니다. 결과가 너무 클 때는 대표 표본만 남기거나, 최신 결과만 원문으로 유지하고 오래된 결과는 짧은 요약으로 치환하는 방식이 필요합니다.
압축은 품질 기준과 함께 설계해야 합니다. 필요한 정보까지 줄어들면 에이전트가 추가 확인을 위해 다시 도구를 호출할 수 있고, 그 결과 전체 비용이 다시 커질 수 있습니다. 어떤 수준까지 압축해도 답변 품질이 유지되는지 측정하고 비교하는 과정이 필요합니다.
온톨로지 검색은 답에 도달하는 경로를 짧게 만듭니다
온톨로지는 기업 안에 흩어진 업무 개념과 관계를 구조화합니다. 고객, 상품, 주문, 계약, 정책, 가격, 재고 같은 개념이 서로 어떻게 연결되는지 정의하고, 특정 질문이 어떤 데이터와 규칙을 참조해야 하는지 판단할 수 있는 기반을 만듭니다.
이러한 지식 사전 구조가 있으면 AI 에이전트는 매번 넓은 범위의 문맥을 다시 읽으며 문제를 풀 가능성이 줄어듭니다. 사용자의 질문을 업무 개념 단위로 해석하고, 해당 개념과 연결된 데이터와 도구를 우선적으로 참조할 수 있습니다. 가격 질문에는 가격 정책과 상품 속성을, 재고 질문에는 창고와 SKU 상태를, 고객 문의에는 계약 조건과 상담 이력을 먼저 확인하도록 설계할 수 있습니다.
온톨로지 검색은 도구 호출의 효율성과도 연결됩니다. AI가 어떤 도구를 호출할지 매번 넓게 탐색하면 loop가 늘어납니다. 업무 개념과 도구의 관계가 정리되어 있으면 특정 요청에서 필요한 도구 후보를 좁힐 수 있습니다. 필요한 정보를 더 적은 시도로 찾을수록 호출 수가 줄고, 누적 컨텍스트도 짧게 유지됩니다.
Solution Cache는 반복되는 탐색을 줄입니다
Solution Cache는 반복되는 업무 질문에서 호출 수를 줄이는 장치입니다. 여기서 캐시는 답변을 그대로 복사하는 기능보다, 사람이 검증한 답변이나 문제 해결 경로를 저장해두고 유사한 질문에서 탐색 과정을 줄이는 구조에 가깝습니다.
예를 들어 사용자가 “7월 매출을 알려줘”라고 질문한 뒤 “8월도 보여줘”라고 요청했다고 가정해볼 수 있습니다. 사람에게는 거의 같은 유형의 후속 요청입니다. AI가 이전에 어떤 지표 정의를 사용했는지, 어떤 데이터 소스를 조회했는지, 어떤 계산 조건을 적용했는지 활용할 수 있다면 같은 탐색을 처음부터 반복할 필요가 줄어듭니다.
Solution Cache 역시 비용과 품질의 균형을 함께 봐야 합니다. 캐시된 해결 경로를 힌트로 제공하면 프롬프트에 포함되는 반복 입력이 조금 늘어날 수 있습니다. 그럼에도 탐색 loop를 줄이는 효과가 충분하다면 전체 비용은 낮아집니다. 모든 질문에 Solution Cache를 항상 주입할 필요는 없습니다. 힌트가 추가되는 비용과 탐색 loop가 줄어드는 효과를 비교해, 어떤 조건에서 캐시를 활용할지 기준을 세워야 합니다. 중요한 점은 언제 힌트를 주입할지 감으로 결정하지 않고, 실제 절감 효과와 품질 영향을 함께 측정하는 운영 기준을 갖추는 것입니다.
비용 최적화는 품질과 함께 설계되어야 합니다

LLM 비용 최적화에서 가장 조심해야 할 부분은 품질을 희생하면서 호출 수를 줄이는 방식입니다. 답을 빠르게 만들 수는 있어도, 잘못된 답변이 업무 의사결정에 사용되면 비용 문제는 훨씬 커집니다. 기업 환경에서 부정확한 AI 답변은 재작업, 승인 지연, 고객 응대 오류, 잘못된 재고 판단, 가격 정책 오류로 이어질 수 있습니다.
기업은 토큰 사용량과 함께 실행 과정의 품질도 관리해야 합니다. 어떤 정보를 참조했는지, 어떤 도구를 호출했는지, 어떤 중간 결과를 남겼는지, 어떤 컨텍스트를 압축했는지 확인할 수 있어야 합니다. 이 기준이 있어야 비용과 품질을 함께 관리할 수 있습니다.
Enhans는 온톨로지 기반 AgentOS를 통해 기업의 업무 맥락과 실행 조건을 구조화합니다. AI가 필요한 정보만 참조하고, 적절한 도구를 호출하며, 반복되는 업무 흐름을 더 짧은 경로로 처리할 수 있도록 돕습니다. AI 비용 최적화는 토큰 사용량을 줄이는 기술 과제이면서, AI가 조직의 업무 기준에 맞게 작동하도록 만드는 운영 과제이기도 합니다.
기업용 AI 챗봇이 PoC를 지나 실제 업무 시스템으로 자리 잡으려면 비용은 예측 가능해야 합니다. 어떤 업무에서 비용이 커지는지, 어떤 질문이 반복적인 loop로 이어지는지, 어떤 컨텍스트가 계속 재전송되는지 확인할 수 있어야 합니다. 반복 호출을 줄이고, 기본 입력을 정리하고, 반복 가능한 업무 지식을 구조화하는 일은 지속 가능한 엔터프라이즈 AI 운영의 출발점이 됩니다.

in solving your problems with Enhans!
We'll contact you shortly!