검색이 ‘답변 제공’에서 ‘작업 완료’로 전환되고 있다: SEO 이후에 무엇이 일어날까?

이전 클라우드 컷 현장 보고서에서笔者는 “Query → Results → Question → Answer → Goal → Plan → Search → Reason → Search Again → Tool → Action → Verify”라는 진화 곡선을 통해 검색의 세 단계를 명확히 설명했습니다. 결과가 발표된 후, 클라이언트들로부터 가장 많이 받은 세 가지 질문은 다음과 같습니다: 이 곡선이 기존 콘텐츠 자산에 무엇을 의미하는지, SEO/GEO를 어떻게 재배치해야 하는지, 그리고 바로 시작할 수 있는 엔지니어링 조치가 무엇인지.

이 글에서 이 세 가지 질문을 자세히 살펴보겠습니다.

搜索与 Agent 能力正在逐步融合

1. 세 단계의 차이는 능력에 있는 것이 아니라 산출물에 있다

간단히 복습하자면: 1세대 검색은 사용자에게 여러 링크를 제공하여 직접 비교하도록 합니다. 3세대 검색은 증거 체인을 포함한 구매 제안서, 예약 초안 또는 능동적인 전략 브리핑을 제공합니다.

이 차이는 추상적인 설명보다 훨씬 구체적이며 비교 가능합니다. 세 가지 실제 업무 시나리오를 통해 살펴보겠습니다:

AI 검색의 3단계 진화: 클라우드 비교부터 호텔 예약까지


첫째, 세 가지 클라우드 제공업체 비교

1세대 검색은 세 곳의 공식 사이트 링크와 여러 평가 페이지를 제공한다. 2세대 검색은 공개된 자료를 정리하여 성능, 가격, 서비스, 생태계 측면의 차이를 알려준다. 3세대 검색은 먼저 고객의 업무 유형, 트래픽, 규정 준수 요구 사항을 파악한 후, 클라우드 제공업체의 공개 가격 API를 호출하고 최신 할인 정책을 수집하여 실제 사용량과 비교한 뒤, 증거 체인이 포함된 구매 제안서를 제공한다. Tavily와 EXA의 공개 비교(Exa vs Tavily)에서 인정한 바에 따르면, Exa는 WebWalker 멀티홉 검색 벤치마크에서 81%로 Tavily의 71%를 앞서며, 지연 시간은 1.4초 대 4.5초다. 이러한 격차는 Agent가 사용자가 기다리는 몇 초 내에 다중 보충 검색을 완료할 수 있는지를 직접 결정한다.

둘째, 호텔 예약

1세대는 여러 예약 플랫폼 링크를 제공한다. 2세대는 목적지와 날짜에 따라 추천 호텔을 제시한다. 3세대는 출장 인원, 예산, 회의실 필요 여부, 식사 선호도, 적립 마일리지 등을 고려해 세 곳의 후보를 선별한 후, 호텔 API를 호출하여 실시간 가격과 객실 유형을 확인하고, 지도 API로 고객 사무실까지의 통근 시간을 계산한 뒤, 캘린더 초대가 포함된 예약 초안을 생성한다.

세대별 경쟁사 모니터링의 진화

경쟁사 모니터링의 세대별 발전 과정을 살펴보면, 1세대는 단순히 “경쟁사 X의 가격”을 검색해相关新闻를 나열했다면, 2세대는 가격 변동에 대한 요약 정보를 제공했다. 3세대에 이르면 경쟁사의 공식 웹사이트, 채용 공고, 버전 업데이트, 사용자 커뮤니티를 지속적으로 모니터링하며, 중요한 변화가 감지되면 자동으로 사용자에게 알림을 보내고 “이번 30% 가격 인하가 당신의上周 배포에 대한 대응인지, 그리고 이것이 당신의 가격 전략에 어떤 의미인지”를 분석까지 해준다.

단순히 정답을 찾는 것에서 실제 업무를 완수하는 것으로의 전환, 그 차이가 바로 이것이다.

이 연구 주기를 완성하는 것이 최초 리콜보다 중요하다

기존 검색 시스템에서는 Recall(재현율), Precision(정밀도), Ranking(순위 매기기)을 중시했다. Agentic Search도 여전히 이러한 역량들이 필요하지만, 평가 기준 자체가 달라져야 한다.

优秀的 Research Agent는 단 한 번의 검색에 그쳐서는 안 된다. 증거가 부족하다고 판단되면 스스로 2차 Query를 생성하고, 두 출처가 서로 충돌하면 제3의 증거를 찾으며, 실시간 가격이 필요하면 별도 API를 호출한다. 그리고 사용자가 실제로 비교하고 싶었던 것이 TCO(총소유비용)라는 사실을 발견하면, 검색 계획을 통째로 재구성해야 한다.

S1-DeepResearch 2026년 논문 서베이에 따르면, 표준 LLM이 멀티턴 검색 없이 멀티스텝 연구 벤치마크에서 달성하는 정확도는 10% 미만이다. 반면 Deep Research Agent(검색-읽기-종합-재조사 순환 안에서 반복하는 시스템)는 50% 이상까지 도달할 수 있다. 다섯 배에 달하는 격차는 특정 기법 하나만의 승리가 아니라, 연구 폐쇄 루프(闭环)의 승리다.

폐쇄 루프란 무엇일까? 여덟 단계로 진행할 수도 있고(Goal → Plan → Search → Reason → Search Again → Tool → Action → Verify), 다섯 단계로 수렴시킬 수도 있다(Plan → Search → Reason → Refine → Conclude).筆者는 두 가지를 모두 사용한다—전자는 복잡한 장거리 작업(기업级 연구,跨領域尽职调查)에 적합하고, 후자는 일상적인 연구 순환에 적합하다. 중간 어느 한 단계에서라도 오류가 발생하면, 이후 단계는 그 오류 위에叠加되어 진행된다.

这也意味着 검색 인프라와 상위 Agent는 별개로 이해해야 한다. Tavily, EXA, Elasticsearch, OpenSearch, Brave Search, Browser Search 모두 Retrieval Provider로 활용할 수 있다. 실제 제품 레이어에서는 Intent, Planning, Source Strategy, Reasoning, Evidence, Evaluation, Action 등의 기능을 담당한다.

실무 지원 경험을 통해 대표적인 반례를 목격한 바 있다. 한 금융기관에서 “검색 증강”을 “더 똑같은 검색 엔진으로 교체”로 이해한 결과, Agent가 첫 번째 라운드에서 회수한 문서에 이미 폐기된旧 정책이 마치 권위 있는 것처럼 표시되어 추가 검색이 트리거되지 않았고, 결국 2년 전에 폐지된 리스크 관리 규정을 인용하게 되었다. 시스템은 겉보기에 원활하게 실행되었으며, 의사결정자도 오류를 발견하지 못했다. 감사 과정에서 인용 출처를 검토,才发现 seluruh Research Loop에 Evidence Age, Conflict Resolution, Source Authority 세 가지 판단 레이어가 부족했다.

검색 품질 평가의 관점을 “검색 결과가 관련성이 있는가”에서 “전체 연구 사이클이 신뢰할 수 있는가”로 확장하는 것——이것은 제가 이 한 해 동안 고객에게 가장 반복적으로 강조해 온 부분이다.

三、Memory가 Agent의 지속 가능성을 결정한다

Agentic Search 포럼에서 Memory는 별도로 다루어졌으며, Long-term Memory(장기 기억), Task Memory(작업 기억), Context Compression(문맥 압축)이 포함된다.

이것은 매우 합리적이다. 작업이 “일문일답”에서 수십 단계에 달하는 연구 과정으로 전환되는 순간, 시스템은 즉시 다음과 같은 문제에 직면한다: 이전에 무엇을 검색하고 검증했으며推翻했으며, 나중에 이를 신뢰할 수 있는 방식으로 기억할 수 있는가.

MemGPT는 2023년에 “LLM as OS” 패러다임을 제안했으며, 핵심은 기억을 계층화하는 것이다: 컨텍스트 윈도우 내의 core memory, 대화 외 저장 계층, 검색 가능한 archival memory. Letta는 2024년에 이를 엔지니어링화했으며, DeepLearning.AI는 2026년에 단기 과정을 개설했다. 이 연구 라인은 참고할 수 있는 명확한 선행 작업이 있어, 우리만의 독창적 용어가 아니다.

연구 작업에서 동일한 정보를 반복 검색하면 상당한 비용이 낭비된다. 더욱 위험한 것은, 이전에 어떤 출처가 신뢰할 수 없다는 것을 발견한 사실을 잊어버린 채, 나중에 다시 인용하는 것이다.

따라서 Task Memory는 구조화된 형태로 기록되어야 합니다. 각 연구 작업이 완료될 때 시스템은 다음 필드들을 영구적으로 저장해야 합니다:

  • 查询计划: 해당 작업을 어떤 하위 문제로 분할했는지, 각 하위 문제의 목표는 무엇인지
  • 来源清单: 각 하위 문제에서 어떤 출처를 참조했는지, 각 출처의 권위 등급과发布日期, 사용 중단 여부
  • 证据快照: 각 출처에서 추출한 핵심 사실과 원문 출처 및 원문 발췌
  • 冲突标记: 출처 간 결론이 불일치하는 부분, 불일치 내용, 시스템이 어떤 것을 선택했는지와 그 이유
  • 阶段结论: 각 검색 라운드 후 시스템이 내린 현재 문제에 대한 임시 판단
  • 失败路径: 결과를 얻지 못한 검색 경로, 그 이유, 다음에 다시 시도할 가치가 있는지 여부
  • 最终判断: 사용자가 이 결론을 수용했는지 거부했는지, 그 이유는 무엇인지

이를 통해 동일한 유형의 작업에 다시 직면했을 때, 시스템은 처음부터 다시摸索할 필요 없이 구조화된 경험을 직접 재활용할 수 있습니다.

慢慢学AI

过去很多团队会用向量数据库(Embedding + Retrieval,即把文字转成向量再按相似度搜索)做 Memory,把全部聊天记录 Embedding 后存起来,下次检索相关片段。这种做法有两个隐患:第一,”相关片段”未必真的相关,模型被噪声干扰的概率反而上升;第二,大量片段没有结构化标签,无法做版本、来源、有效期管理。Memory 真正需要的是设计沉淀、评价和结构化,否则 Context 越积越多,下一次决策反而更不确定。

四、自进化真正有价值的部分,是把成功经验沉淀成 Skill

현장에서는 Agent Swarm(멀티 에이전트 협업)과 “자기 진화(Self-Evolution)”闭环도 시연되었습니다.

이러한 표현은 모델이 스스로를 훈련시키는 것으로 쉽게 연상될 수 있습니다.보다 정확한 이해는 에이전트가 작업 완료 후 평가, 인적 피드백 및 결과 검증을 통해 가치 있는 방법을 Memory, Knowledge 및 Skill로 축적하는 것입니다.

예를 들어, 20번 연속으로 제품 기회 조사 작업을 수행한 후, 시스템은 점차 Product Opportunity Research Skill를 형성할 수 있습니다.이 Skill은 단순한 프롬프트 조각이 아니라 다음과 같은 내용을 규정해야 합니다:

  • Trigger: 어떤 유형의 작업이 이 스킬을 발생시키는가
  • Goal: 이번 연구의 성공 기준은 무엇인가
  • Context Schema: 사전에 로드해야 할 기업 맥락(브랜드, 카테고리, 타겟 시장)은 무엇인가
  • Constraints: 신뢰할 수 없는 출처, 인용할 수 없는 데이터는 무엇인가
  • Tools: 순서대로 호출할 검색 소스, API, 데이터베이스는 무엇인가
  • Workflow: 단계 순서 (시장 진입점을 먼저 파악 → 주요 경쟁사 탐색 → 가격·트래픽·사용자 리뷰 확인 → Reddit 및 커뮤니티 불만 사항 검토)
  • Source Priority: 신뢰할 수 있는 출처 우선(공시 재무제표/연차 보고서), 그 다음 커뮤니티, 마지막으로 블로그 순서
  • Verification: “수요가 존재한다”는 결론을 뒷받침할 수 있는 충분한 증거는 무엇인가
  • Output Schema: 최종적으로 출력할 필드와 각 필드의 형식은 무엇인가

이 글에서 독자들과 구분해야 할 점이 있다: 위의 Skill 필드一组는 OpenAI Function Calling(외부 함수를 모델이 호출할 수 있는 JSON Schema 인터페이스로 등록하는 것)과는 다르다—Function Calling은 도구 레이어 프로토콜이다. Anthropic Tool Use(Function Calling과 유사하지만 Anthropic은 더 세분화된 tool_use/tool_result 메시지 타입을 사용)와도 다르다—마찬가지로 도구 레이어에 머물러 있다. AutoGen의 Agent Spec은 Agent의 역량 설명을 직렬화 가능한 객체로 표준화한 것으로,这里的 Skill과도 부분적으로만 일치한다. Skill의 진정한 핵심은 “팀이 수십 차례 실제 운영을 통해沉淀下来的工作流模板”이다. Skill은 Tools, Workflow, Constraints, Verification이라는 네 가지层面을 하나로 묶는다—이는 OpenAI/Anthropic/AutoGen의 프로토콜 레이어가 모두 다루지 않는 영역이다.

같은 종류의 조사를 21번째 수행할 때, 방법을 다시 발명할 필요가 없다. 이것이 Skill의 진정한 복리 효과다.

连锁 통신 리테일 브랜드의 AI 전환을 지원하면서 이 과정의 발전을 직접 목격했다. 첫째 주, Agent가 경쟁사 분석을 수행할 때 각 제품 매니저는 검색 경로, 소스 우선순위, 판단 기준을 다시 교육받아야 했다. 세 번째 주에는 모든 라운드에서 “효과적”이었던 연구 경로를 Skill로 정리하고, 잘못된 것들(예: 단일 데이터 소스에 대한 과도한 의존)은 명확히 표시했다. 여덟 번째 주에는 새로 합류한 제품 매니저가 목표만 시스템에 입력하면,产出된 분석 보고서의 품질이 두 번째 주 가장 경력 높은 멤버의 초안보다 안정적으로 높았다. 참고: 세 시점의 진화는示意적 과정 설명이며, 구체적인 속도는 프로젝트에 따라 다를 수 있다.

이것이 바로 Skill의 진정한 가치다: 팀 내 다양한 사람 머릿속에 흩어져 있는 암묵적 方法론을 팀이 공유하고, 계승하며, 개선할 수 있는 엔지니어링 자산으로沉淀하는 것.

진정한 自进化은 따라서 Evaluation(품질 평가)에 의존한다. 명확한 결과 평가가 없다면 잘못된 경험도 保存되어, 시스템은 점점 더 자신감 있게 실수를 반복하게 될 것이다.

다섯 번째, SEO는 사라지지 않았지만, 퍼널이 한 단계 더 추가되었다

과거 SEO의 가장 대표적인 퍼널은 Ranking → Impression → Click → Signup → Paid였다. 생성형 검색이 등장한 이후, 사용자는 검색 페이지, ChatGPT, Perplexity 또는 기타 Agent에서 직접 답변을 얻을 수 있게 되어 각 소스를 클릭하지 않게 되었다.

Pew Research Center가 2025년 3월 미국 성인 900명이 수행한 68,879건의 실제 Google 검색을 추적한 결과, AI 요약이 표시된 검색에서는 사용자의 전통적 결과 클릭 비율이 8%에 불과했고, AI 요약이 없을 때는 이 비율이 15%였다. 전체 클릭의 거의 절반이 줄어든 셈이다.

이러한 변화는 콘텐츠의 가치를 ‘클릭 유도’에서 ‘AI 모델이 인용하고 의존하는 근거로 인정받는 것’으로 확장시킨다. 운영 지표에는 새로운 흐름이 추가될 것이다: AI Visibility → Citation/Mention → AI Referral → Qualified → Signup → Paid로 이어지는链路다.

이 체인을 네 가지 단계로 살펴보면: 인식, 인용, 클릭, 전환. AI Visibility는 기반이며, 자신의 브랜드나 제품이 AI 답변에 언급되는지를 의미한다. Citation/Mention은 인용 횟수, 어떤 맥락에서 등장하는지, 인용이 정확한지를 포함한다. AI Referral은 사용자가 해당 인용을 따라 여러분의 웹사이트에 방문하는지, 그리고 얼마나 많은 양질의 트래픽을 가져오는지를 의미한다. Qualified는 이 방문자 중 몇 명이 추가로 가입, 체험, 상담하는지를 나타낸다. 최종적으로는 Signup과 Paid로 귀결된다.

GEO 업계에서 제시하는 기준치 참고치는 다음과 같다: Perplexity 인용률 97%, Google AI Overviews 34%, ChatGPT 16%. AI 트래픽은 현재 전체 웹사이트 트래픽의 약 1.08%를 차지하지만, Perplexity 유입의 전환율은 Google 자연검색보다 3.1~4.4배 높고, 세션时长은 4.7배 더 길다. 이 두 수치는 모두 차원의 차이를 보여주는 수치다. 구체적인 수치는 사이트와 업종에 따라 달라질 수 있지만, “AI 트래픽은 적지만 질이 높다”는 추세는 확실하다.

它和传统 SEO 漏斗最大的差别是:中间多了 Citation/Mention 和 AI Referral 两个新环节,而且 Citation 质量比 Citation 数量更重要。一个 AI 答案里把你的产品引用为”另一个可选方案”和把它引用为”针对这个场景最值得评估的三个产品之一”,带来的 Qualified 流量天壤之别。Ahrefs 数据科学家发现,Google AIO 引用源大概每轮有 45% 变化——这意味着光靠”被引用过一次”是不够的,要看 Citation Persistence(被引用的持续性)。

여기서 한 가지 오해를 피해야 한다. Citation 자체도 Vanity Metric이 될 수 있다. 만약 한 브랜드가 수많은 AI Answer에서 언급되지만, 고품질 트래픽이나 브랜드 검색, 注册 또는 매출로 이어지지 않는다면, 단순히 인용 빈도만으로는 비즈니스 가치가 제한적이다.

따라서 GEO는 결국 완전한 Funnel으로 돌아가야 한다. 그러나 중간衡量標準은 이미 바뀌었다: “검색되는 것”이 아니라 “AI가 신뢰하여 전述할 정도로 여기는 것”이다.

六、内容建设开始为问题空间建立可靠证据,只是为关键词写 것이 아니라

콘텐츠 구축은 더 이상 키워드를 위한 것이 아니라, 문제 공간에 대한 신뢰할 수 있는 근거를 확립하기 위한 것이다.

전통적 SEO와 Agentic Search의 변화

전통적인 SEO는 Keyword 중심으로 콘텐츠 매트릭스를 쉽게 구축할 수 있었다. 하나의 키워드에 하나의 페이지를 대응시키고, 순위 확보와 롱테일 키워드, 백링크 확보가 핵심 목표였다.

그러나 Agentic Search 시대가 도래하면서, 콘텐츠는 여전히 검색 수요를 충족해야 하지만 구조적으로 문제 공간(Problem Space)에 더 가깝게 변하고 있다. AI 에이전트는 연구 작업에서 여러 하위 문제를 연속적으로 제기할 수 있고, 다양한 출처를 비교 분석하기도 한다. 이로 인해 명확하고 검증 가능하며 구조가 안정적이며 출처가 명확한 정보에 대한 요구가 크게 높아졌다.

이러한 변화에 대응하기 위해 콘텐츠 구축은 Keyword 중심을 넘어 다섯 가지 차원의 안정성을 함께 구축해야 한다:

  • Entity(개체) 명확성
  • Fact(사실) 검증 가능성
  • Date(날짜) 표시
  • Source(출처) 추적 가능성
  • Topical Coverage(주제 적용 범위) 완전성

결론적으로, 과거처럼 순위를 위해 낮은 정보 밀도의 페이지를 무더기로 쌓아올리는 방식은 Agentic Search 환경에서는 더 이상 효과적이지 않을 것이다.

AI 에이전트의 연구 방식과 콘텐츠 신뢰성

AI 에이전트는 연구 시 “개체가 명확하고, 사실이 검증 가능하며, 출처가 명확하고, 주제가 완전한” 페이지를 우선적으로 선택한다. 반면 “제목에 키워드를 세 번 반복堆积한” 내부 페이지는 선호하지 않는다. GEO-Bench(2026년 ACL 논문 FeatGEO에서 사용한 벤치마크)의 분석 결과에 따르면, 문서 수준의 콘텐츠 속성(구조, 내용, 언어)이 인용률에 미치는 영향이 흩어진 키워드 수준 편집보다 훨씬 크다. 각 사실 진술에 원문 출처를 함께 제공하고, 각 숫자에 시간 범위를 명시하며, 페이지 간의 주제 관계를 명시적으로 연결하는 것—이전 세대의 SEO에서는 크게 중시하지 않았던 이러한 작업들이 GEO 시대에는 핵심 과제로 부상했다.

특정 분야에 걸쳐 AI가 신뢰할 수 있는 콘텐츠를 지속적으로 생산할 수 있는 사이트라면, 검색과 AI 에이전트 시대 모두에서 훨씬 더 높은 가치를 지닌다.

B2B 제조업 고객 여러 곳과 콘텐츠 전략을 함께 수립하면서 이를 실증했다. 산업 자동화를主营하는 한 고객사가 지난 3년간의 제품 매뉴얼, 업계 논문, 백서를 “개체—사실—날짜—출처” 네 가지 차원에 따라 재구성하고, 사이트 수준의 주제 맵을 추가했다. 그 결과 6개월 후, 주류 AI 답변에서 해당 제품 페이지의 인용률이 약 3배 증가했으며, 이를 통해 발생한 Qualified Leads는 약 40% 증가했다. 참고: 이 두 수치는 방향성을 보여주는示意이며, 프로젝트 비식별화 후レビュー에서 도출된 것이다. 구체적인 배수는 업계, 초기 수준, 실행 깊이에 따라 달라지므로, 공개적으로 재현 가능한 정밀 데이터가 아니다.

七、검색 API가 점점 Agent의 인프라 계층처럼 되고 있다

개발자에게 이 변화는 하나의 엔지니어링적 함의를 더 가진다.

앞으로 ‘검색’을 단독 제품 능력으로 고립시켜 구축해서는 안 된다. 더 합리적인 아키텍처는 3단계로 구성된다:

첫 번째 계층, Search Infrastructure. 이 계층은 Provider에 종속되지 않는 검색 기반 시설로서, Tavily, EXA, Brave, Google, Bing, OpenSearch, Elasticsearch, 자체 구축 검색 등 다양한 Provider의 키, 할당량, 비용, 안정성, 캐시, 라우팅 및 디그레이드 전략을 관리한다. 이 계층의 인터페이스는 특정 Provider의 SDK(Software Development Kit)가 아닌, 통합된 “검색 + 근거 반환” 형태를 제공한다.

慢慢学AI<002>

이 层은 классический RAG(检索增强生成) 아키텍처의 “Document Store / Retriever / Generator / Reranker / Prompting Strategy” 다섯 계층과 병렬 관계에 있으면서도 완전히 일치하지 않는다. RAG가 “질문과 답을 한 번에 완료”하는 패러다임이라면, Search Infrastructure는 “Agent가 여러 번 호출하고 동적으로 연결”하는 패러다임이다. 이 둘을 혼용하면 Reranker와 Source Priority 부분에서 혼동되기 쉽다.

第二层, Research Agent. 이 계층은 Planning(规划), Query Expansion(查询扩展), Retrieval(检索), Reasoning(推理), Evidence Assessment(证据评估), Verification(验证), Action Orchestration(行动编排)을 담당한다. 직접 Provider를 호출하지 않고, 第一层의 통일된 추상을 통해 후보 증거를 확보한 뒤, 어떤 증거가 신뢰할 수 있고 어떤 것이 충돌되어 추가 검색이 필요한지를 결정한다.

세 번째 계층, Domain Skill

SEO 리서치, Competitor Research, Academic Research, Product Research, Legal Research 등 다양한 태스크에 대해 특화된 메서드, 소스 우선순위, 검증 규칙, 출력 스키마를沉淀한다. Skill이 Agent를 호출하고, Agent가 Infrastructure를 호출한다.

이러한 계층화는 비대칭적인 이점을 제공한다.底层 Provider는 교체 가능하다——Tavily에 문제가 생기면 임시로 EXA로 전환할 수 있어,业务部门는 Provider를 변경하기 위해 Research Loop를 다시 작성할 필요가 없다. 상위 계층의 역량은 지속적으로 누적되어,业务部门는 Provider 전환으로 인해 Skill을 다시 작성하지 않아도 된다. 이것이 계층화의 진정한 가치——**역결합(Decoupling)**이다.

한 금융 고객사의 AI 팀은 지난해 이 아키텍처를 시도했다. 검색을 “엔지니어링 팀마다 각각 다른 API를接入하는” 방식에서 이 세 계층으로 재구성한 것이다. 그 결과, 엔지니어링 팀은 “특정 Provider의 갑작스러운 Rate Limit”로 인한中断 없이 업무를 수행할 수 있게 되었고,业务 팀은 하위가 누구를 호출하는지 신경 쓰지 않고 Skill으로 “어떤 리서치를 수행할지” 직접 정의할 수 있게 되었다. 3개월 만에 팀 간 리서치 태스크의交付 시간이 약 절반으로 단축되었다. 주: 절반 단축은 탈감염 프로젝트의 방향성 검토 수치이며, 구체적인 배율은 팀 규모와 기존 구조의 차이에 따라 달라진다.

진정한 변화는 ‘정보 획득’이 과제 수행에 포함된다는 것

AI 검색을 단순히 “검색창이 더 똑똑해졌다”고 이해한다면, 이번 변화를 크게 과소평가하는 것이다.

Search, Memory, Tool Use, Action이 하나로 통합되면, 사용자가 진정으로 요청하는 것은 점점 ‘목표’에 가까워지고, Query는 시스템 내부로 후퇴하게 된다.

“이 주제에 관한 자료 몇 편 찾아줘”는 “이 시장을 연구하고, 여러 방안을 비교해서 근거와 권고안을 제시해줘”로 변한다. “호텔 찾아줘”는 “이러한 조건에 맞는 호텔을 찾고, 총 비용을 비교한 후 예약 준비까지 완료해줘”로 변한다. “경쟁사 정보 조회해줘”는 “경쟁사를 지속적으로 모니터링하고, 중요한 변화가 발견되면 알려주며, 그것이 현재 전략에 영향을 미치는지 설명해줘”로 변한다.

이러한 전환은 네 가지 업종에서 각기 다른 의미를 갖는다.

통신 분야에서, Agent는 더 이상 “5G 요금제 중哪家가 더 싼지”라는 질문에 불과하게 응답하지 않는다. 사용자의 통화, 데이터 사용량, 로밍 패턴을 분석하여 기존 요금제가 비용 대비 합리적인지 비교하고, 계약 만료 시기에 맞춰 “재계약 / 요금제 변경 / 번호 이동” 세 가지 옵션을 제공하며, 비교 결과를 직접 사용자에게 전송한다.

금융 분야에서, Agent는 더 이상 “ETF가 무엇인지” 설명하는 데 그치지 않는다. 사용자의 허락 하에 사용자의 자산 배분, 시장 동향, 규제 정책 변화를 파악하여 능동적으로 포트폴리오 조정 권고안을 제시하며, 각 권고안에 대한 근거 출처를 함께 제공한다.

제조 시나리오에서 Agent는 더 이상 “이 기계의 고장 코드를 찾아줘”라는 수준을 넘어섰다. 장비 로그, 센서 데이터, 최근 유지보수 기록을 종합적으로 분석하여 고장 원인을 교차 판단하고, “오늘/내일/이번 주말” 세 가지 유지보수方案을 제시하며, 부품 목록과 예상 공수를 포함하여 직접 작업 지시를 생성한다. 이러한 시나리오는 2026년 산업 Agent 적용에서 가장 설득력 있는 사례다. CNC 가공센터의 진동 데이터, 3개월치 유지보수 기록, 해당 근무조 센서 경보 정보를 종합하면, 수동 조사의 경우 4시간이 소요되는 반면, 증거 체인을 갖춘 다단계 Agent 검색은 8분 만에 세 가지 대응 방안을 제시한다. 또한 각 방안에는 증거 출처가 명시되어 있다.

전자상거래 시나리오에서 Agent는 더 이상 “경쟁사 가격을 찾아줘”가 아니라, 전 플랫폼의 가격, 재고, 프로모션 상황을 지속적으로 모니터링한다. 사용자가 가장 관심 있는 SKU가 “최근 30일 평균가 대비 20% 하락”할 때 자동으로 알림을推送하며, 자체 가격 조정 여부를 제안한다.

검색은 여전히 존재하지만, 더 큰 작업 시스템 안으로 후퇴했을 뿐이다.

콘텐츠, SEO, AI 제품에 있어 진정으로 주목할 가치가 있는 것은 바로 이 단계다: 누가 지속적으로 신뢰할 수 있는 증거를 생성할 수 있는지, 누가 검색을 인용으로 전환할 수 있는지, 누가 인용을 다시 행동으로 전환할 수 있는지가 핵심이다.


의사결정자를 위한 시사점

최고 경영자나 디지털 전환 담당 부사장이라면, Agentic Search 도입에서 진정으로 결정해야 할 것은 “어떤 검색 API로 교체할지”가 아니다. 세 가지가 핵심이다:

AI 천천히 배우기 <001>

증거 인프라——귀사의 제품 매뉴얼, 업계 보고서, 백서, 고객 서비스 기록을 “개체-사실-날짜-출처”라는 4가지 차원에서 구조화했는가? 이것이 Agent가 장기적으로 귀사 정보를 인용할 수 있을지 여부를 결정하는 전제 조건이며, 단순한 SEO 도구로 대체할 수 있는 것이 아니다.

Skill 자산——팀에서 가장 베테란인 직원이 머릿속에 가지고 있는 “X 상황이 발생하면 이렇게 대응한다”는 암묵적 경험이 재사용 가능하고 개선 가능한 Skill로 축적되었는가? 그렇지 않다면, AI 도입할 때마다 처음부터 다시 시작해야 한다.

평가 피드백 루프——AI 출력의 정오를 판단하는 기준이 무엇인가? Evaluation 없는 자가 발전은 오류를 점점 더 자신 있게 반복하는 것으로 이어질 뿐이다.

이 세 가지의 공통점: 어디에도 구매 목록에 포함되어 있지 않으며, 모두 조직 내부에 존재한다.


자주 묻는 질문

Q1: Agentic Search가 등장한 이후, 전통적인 SEO는 더 이상 필요 없는 것인가?

아닙니다. SEO는 GEO의 기초입니다. 만약 전통 검색에서조차 순위가 낮다면, AI에게 인용될 확률은 더욱 낮아집니다. SEO는 “검색 가능하게 만든다”는 것이고, GEO는 “AI가 신뢰하여 인용할 정도로 신뢰받는다”는 것이다. 이 둘은 대체 관계가 아니라 별개의 영역입니다.

Q2: Citation 수는 증가했는데, 왜 Qualified Leads는 늘어지지 않는가?

아마도 Citation质量问题일 것이다. AI 답변에서 당신이 단순히 ‘다른 대안 중 하나’에 불과한 것과, ‘평가할 가치가 있는 세 가지 중 하나’로 언급되는 것의 차이는 매우 큽니다. 전자는 단순 조회이고, 후자는 실제 상담으로 이어집니다. 단순히 숫자를 보는 것보다, 당신의 Citation이 AI 답변에서 어떤 위치에, 어떤 맥락에서 나타나는지를 확인하는 것이 훨씬 유용합니다.

Q3: 지금 바로 Research Agent를 자체 구축해야 하는가?

먼저 문제의 범위를 살펴보자. 연구 업무에 비공개 데이터(고객档案, 내부 产品手册, 규정 준수 기록)가 필요하고 규정 준수 조정이나 규제 해석이 수반된다면 자체 구축이 필수적이다. 반면 연구 업무가 주로 공개 정보 중심이라면, 기존 도구(Tavily / EXA / Perplexity /阿里云 OpenSearch Agentic Search 등)를 먼저 활용하면서 3~6개월간 생태계의 안정성을 관찰한 후 자체 구축 여부를 결정하는 것이 바람직하다.


역방향 자기 점검(스스로를 기만하지 않는 방법)

AI 관련 글

  • “AI에게 인용당하는 것”을 KPI로 삼지 말고 수단으로 삼으세요 – 인용이 등록이나 상담으로 이어지지 않는다면, 이는 허세에 불과한 지표입니다.
  • Skill 축적을 문서 한 번 작성하는 일회성 작업으로 여기지 마세요 – Evaluation이 없으면, 잘못된 것까지 그대로 쌓이게 됩니다.
  • 검색 API를 단순 엔지니어링 문제로 치부하지 마세요 – 검색 품질 평가는 본질적으로 연구 사이클의 신뢰성 문제이며, 인터페이스 선택만으로는 해결되지 않습니다.
  • “AI가 얼마나 했는가”를 증거로 삼지 마세요 – 진짜로 봐야 할 것은 “그 결과 시스템이 무엇을 바꾸었는가”입니다.

현재 기업 검색/SEO 팀이 Agentic Search를 어떻게 도입하고 있는지, 어떤 GEO 지표를 추적해야 하는지, 어떤 콘텐츠 자산이 AI 인용의 대상이 될지 고민이라면, 편하게 이야기해 주세요. 저희는 기업 AI 전환 전문 컨설팅을 제공합니다 – 검색 아키텍처, 콘텐츠 전략부터 GEO 지표까지, “웹페이지가 발견되는 것”을 “AI가 인용할 만큼 신뢰받는 것”으로 발전시킬 수 있도록 도와드립니다.

  • 기업 교육 – 검색 아키텍처, 콘텐츠 자산, GEO 측정 방법을 팀에서 바로 활용할 수 있는 워크숍으로 진행합니다(2~3일, 기초+실습).
  • 전문 컨설팅 – 현재 검색 인프라, Skill 축적 경로, Citation 품질에 대한 진단과 실행 로드맵을 제공합니다.
  • 경영진 세미나 및 업계 발표 – 검색 3단계, 콘텐츠를 문제 공간으로 접근하기, GEO 퍼널 등의 프레임워크를 업계 컨퍼런스나 경영진 회의에 가져다 드립니다.

연락邮箱:[email protected]

延伸阅读:《AI 转型七步框架》,系统讲清楚企业落地 AI 的完整路径。


본 시리즈에 대하여

「云栖观察」는 IAIUSE가,推出하는 산업 현장을 주제로 한 시리즈로, 2026년 云栖大会에서 출발하여 연구자의 시각으로 AI 산업에서 실제로 일어나고 있는 변화를 해체 분석합니다——트렌드를 쫓는 것이 아니라, 어떤 방향에 투자하고 있는지와 그 근거의 강도를 중시합니다.

이 시리즈는 모델 상위 시스템 레이어, Agent 구현, Context 자산, 기업 AI 조직 설계, AI 제품 경쟁 단위의 이동 등 주제를 다루며, 총 10편으로 구성됩니다.

저는 약 8년간 대형 기업 컨설팅 및 비즈니스 분석 경험을 보유하고 있으며, IBM에서 근무하며 통신, 금융, 보험, 제조업 관련 프로젝트에 참여했습니다. 이후에도 통신사 제품, 인터넷 제품, AI 애플리케이션 개발 현장에서 요구사항 분석, 제품 설계, 크로스 팀 구현을 수행해왔습니다. 이 계정을 운영하는 것은 사실 작은 팀입니다——저와 1~2명의 장기 협력 동료가 AI 코딩 도구 연구, 조직 거버넌스 사례 정리, 코칭 대화 등의 영역을 나누어 담당하고 있습니다. 본문에서 “기업과 함께 해결해 나간” 대부분의 프로젝트는 우리 몇 명이 함께 수행한 것입니다.

본 시리즈의 판단은 현장 관찰과 업계 교차 검증을 바탕으로 하며, 명확한 저자의 입장을 담고 있어 어떤 제조사의 관점도 대변하지 않습니다.

현지화 핵심 포인트(다국어 번역 가이드, IAIUSE 다국어 전략·2026-08-09 합의)

19개 언어로 번역할 때, 아래 내용들은 대상 언어 시장의 상황에 맞게 현지화하여 대체한다. 구조나 시각적 요소는 그대로 유지한다.

中文稿内容 한국어版
阿里云 OpenSearch Alibaba Cloud OpenSearch (유지)
Tavily / EXA Tavily / EXA (글로벌 제품 유지)
ChatGPT / Perplexity ChatGPT / Perplexity
百度 / Google Google
중국 통신 3사 AT&T / Verizon / T-Mobile NTT / KDDI / 소프트뱅크 Deutsche Telekom / Vodafone STC / 이티살라트
핀후 / 딩딩 Slack / Teams Slack / Teams / Lark Slack / Teams Microsoft Teams
Tavily / Exa 사례 현지화 Tavily / Exa(원 사례) Tavily / Exa(원 사례) Tavily / Exa(원 사례) Tavily / Exa(원 사례)
차이나 머천츠 뱅크 / ICBC JPMorgan Chase / Bank of America 미쓰비시 UFJ / 미쓰이 스미토모 Deutsche Bank / Commerzbank National Commercial Bank(사우디)/ QNB

|连锁零售ブランド(匿名化)|Target / Best Buy(匿名化)|イオン / セブン&アイ(匿名化)|Lidl / Aldi(匿名化)|Panda / Al Othaim(匿名化)|
|産業自動化クライアント(匿名化)|Honeywell / GE(匿名化)|ファナック / 安川電機(匿名化)|Siemens / Bosch(匿名化)|SABIC / Aramco(匿名化)|
|金融クライアント(匿名化)|JPMorgan / Goldman(匿名化)|三菱UFJ / SMBC(匿名化)|Deutsche Bank(匿名化)|NCB / QNB(匿名化)|

인용 설명(항목별, 2026-08-09 합의·게이트 1必검토)

# 文中引用 来源 发布日期 証拠階層 立場标注
1 “Exa 81% / Tavily 71% WebWalker 다중 홉 벤치마크; Exa 1.4s / Tavily 4.5s p95 레이턴시” exa.ai/versus/tavily (Exa Labs 공식 비교 페이지) 2026-02-12 검증된 사실 (업체 자사) Exa 사 propres页面, Exa 관점 포함; WebWalker 제3자 벤치마크는 독립 검증 가능
2 “알리바바 클라우드 OpenSearch Agentic Search 2026-08-31부터 상용화, 그 전엔 공개 테스트 무료” alibabacloud.com/help/doc-detail/3053142.html (알리바바 클라우드 OpenSearch 공식 문서) 2026-08-31 적용 검증된 사실 (공식 문서) 알리바바 클라우드, 업체 입장

| 3 | “표준 LLM 다중 검색 미수행 시 정확률 < 10%, Deep Research Agent > 50%” | tianpan.co/blog/2026/04/12/deep-research-agents… (업계 분석); 관련 논문 arxiv.org/html/2606.15367v1(S1-DeepResearch 종합) | 2026-04 | 업계 관찰(분석가 종합) | Tianpan 독립 분석가; S1-DeepResearch 논문 동료 검토 |
| 4 | “MindDR, BrowseComp-ZH 45.7% / DeepResearch Bench 52.5” | arxiv.org/html/2604.14518v1(理想자동차 Mind DeepResearch Technical Report) | 2026-04-14 | 검증된 사실(논문) |理想자동차 자체 개발 모델, 제조사 입장 |

| 5 | “DRBench: 기업 심층 연구 태스크 100개, 1093 하위 질문, 10개 영역” | arxiv.org/pdf/2510.00172(ServiceNow Research) | 2025-10 | 검증된 사실(논문) | ServiceNow 자체 연구 |
| 6 | “MemGPT 2023 논문 ‘LLM as OS’ 계층 패러다임; Letta 2024 엔지니어링 구현; DeepLearning.AI 2026 단기 과정” | blog.stackademic.com/letta-platform… ;letta.com/blog/benchmarking-ai-agent-memory;linkedin.com/posts/deeplearningai… | 2023-2026 | 검증된 사실(기술 리뷰) | MemGPT/Letta 자사 블로그, 도구 제공사 관점 |

| 7 | “Pew Research: 미국 성인 900명, 총 68,879회 Google 검색; AI 요약 제공 시 클릭률 8%, 미제공 시 15%” | instituteforpr.org/do-ai-summaries-reduce-clicks-on-google(Pew Research 종합) | 2025-07 | 검증된 사실(독립 연구) | Pew Research 독립 연구기관 |

| 8 | “Perplexity 인용률 97%, Google AIO 34%, ChatGPT 16%; AI 유입이 전체 웹사이트 트래픽의 약 1.08%를 차지하며, 전환율은 Google 자연 검색보다 3.1~4.4배 높고, 세션 시간이 4.7배 길다” | cite.solutions/generative-engine-optimization(2026-05-02);omnius.so/blog/generative-engine-optimization-kpis-and-metrics(2026-08-18);trycited.app/generative-engine-optimization(2026-08-17) | 2026-05/08 | 업계 관찰(다수 GEO 도구 공급자 데이터);MarGen 2026 인용 | GEO 도구 공급자 자체 데이터, 도구 공급자 측 관점 |

| 9 | “Ahrefs:Google AIO 인용 소스 비율은 라운드마다 약 45% 변동” | omnius.so/blog/generative-engine-optimization-kpis-and-metrics(2026-08-18) | 2026-08-18 | 업계 관찰(SEO 툴 공급사) | Ahrefs,SEO 도구 제공사 관점 |
| 10 | “FeatGEO:GEO-Bench, 3개 생성 엔진 대상 테스트 결과 - 문서 레벨 콘텐츠 속성이 인용률에 미치는 영향이 키워드 레벨 편집보다 큼” | aclanthology.org/2026.acl-long.929/(ACL 2026 장문) | 2026 | 검증된 사실(동료 심사) | 학술 연구 |
| 11 | “Gemini 3.1, DeepResearch Bench에서 RACE 49.65, 인용 정확률 77.20%” | arxiv.org/html/2604.14518v1(동일 MindDR 논문 내 각 사 비교 포함) | 2026-04 | 검증된 사실(논문) | 서드파티 벤치마크,비중립적 관점 |

| 12 | “RAG의 고전적 5단계 아키텍처: Document Store / Retriever / Generator / Reranker / Prompting Strategy” | medium.com/@angelosorte1/rag-architectures-every-ai-developer-must-know-in-2026(Angelo Sorte 종합);levelop.dev/blog/…/agent-rag-architecture-five-layer-retrieval-stack(2026-07-23);braintrust.dev/articles/best-vector-databases-for-rag-2026 | 2026 | 업계 동향(기술 종합) | 엔지니어링 실무 종합 |

| 13 | “Anthropic Agent Skills 파일시스템 수준 리소스,스킬 온디맨드 로딩,컴포저블” | docs.anthropic.com/en/docs/agents-and-tools/agent-skills/overview(Anthropic 공식 문서) | 2026 | 검증된 사실(공식 문서) | Anthropic,업체 입장 |

文中 표시된 “역정제/示意性” 고객 사례(체인 Retail 브랜드演化, B2B 산업 자동화 고객 3배 레퍼런스율/40% Qualified Leads 증가, 금융 고객 납기 단축 절반): 파트너링 프로젝트 역정제 회고에서 비롯됨, 어떤 특정 고객도 지목하지 않음, 수치는 방향성示意임。