La búsqueda evoluciona de 'dar respuestas' a 'completar tareas': ¿Qué ocurre después del SEO?
La búsqueda está pasando de “dar respuestas” a “completar tareas”: ¿Qué viene después del SEO?
En la observación in situ del Cloud Town que compartimos anteriormente, usamos esta curva de evolución: «Query → Results → Question → Answer → Goal → Plan → Search → Reason → Search Again → Tool → Action → Verify», para explicar las tres fases de la búsqueda. Tras la publicación, las tres cuestiones más recurrentes entre nuestros clientes fueron: qué implica esta curva para los activos de contenido existentes, cómo deben reposicionarse el SEO y el GEO, y qué acciones de ingeniería pueden implementarse de inmediato.
En este artículo desarrollamos estas tres cuestiones en profundidad.

1. La diferencia entre las tres fases no está en las capacidades, sino en los entregables
Hagamos un breve repaso: la primera generación de buscadores te proporciona varios enlaces para que el usuario compare por su cuenta. La tercera generación te entrega un informe de recomendación de compra con cadena de evidencia, un borrador de reserva, o un briefing estratégico proactivo.
Esta diferencia es más concreta y easier de comparar de lo que sugiere la descripción abstracta. La ilustramos con tres escenarios laborales reales:
慢慢学AI 031
迭代的三个阶段:从信息罗列到智能体驱动的采购决策
三代搜索的演进
云服务商对比
第一代搜索仅返回三家云服务商的官网链接和相关评测页面;第二代搜索会将公开资料整合成一段综述,概述在性能、价格、服务和生态方面的差异;而第三代搜索则会先了解你的业务类型、流量规模和合规需求,调用云服务商公开的报价 API、实时抓取最新的优惠政策,并与你的实际用量进行比对,最终生成一份附带完整证据链的采购建议书。
在 Exa 与 Tavily 的公开对比中,Tavily 坦承 Exa 在 WebWalker 多跳检索基准测试中达到 81%,而 Tavily 为 71%;在延迟方面,Exa 为 1.4 秒,Tavily 为 4.5 秒——这种性能差距直接决定了智能体能否在用户等待的那几秒内完成多轮补充检索。
酒店预订
第一代搜索返回若干预订平台的链接;第二代搜索根据目的地和日期推荐酒店;第三代搜索则会根据出行人数、预算、是否需要会议室、餐饮偏好以及累计里程等条件,筛选出三个候选酒店,调用酒店 API 获取实时价格和房型信息,再调用地图 API 计算到客户办公室的通勤时间,最终生成一份附带日历邀请的预订草稿。
Tercer punto, monitoreo de competidores. En la primera generación, cuando buscas “precio del competidor X”, obtienes algunas noticias; en la segunda generación, recibes un resumen de los cambios; la tercera generación monitorea continuamente el sitio web, las contrataciones, los lanzamientos de versiones y las comunidades de usuarios de tus competidores, notificándote proactivamente cuando detecta cambios importantes y explicándote “¿esta降价 del 30% es una respuesta a tu lanzamiento de la semana pasada, y qué significa para tu estrategia de precios?”.
La diferencia entre el objetivo de “encontrar una respuesta” y el de “completar una tarea” es exactamente la que se muestra arriba.
2. El bucle de investigación es más importante que la primera recuperación
Los sistemas de búsqueda tradicionales dan gran importancia a Recall, Precision y Ranking. Agentic Search todavía necesita estas capacidades, pero los criterios de evaluación deben cambiar.
Un buen Research Agent no debería buscar solo una vez. Debe generar una segunda ronda de consultas cuando 发现证据不足; buscar evidencia de terceros cuando dos fuentes entren en conflicto; invocar otra API cuando necesite precios en tiempo real; y reorganizar el plan de búsqueda cuando descubra que lo que el usuario realmente quiere comparar es el TCO (costo total de propiedad).
Learn AI Slowly: Sobre los sistemas de investigación de ciclo cerrado
Un estudio publicado por S1-DeepResearch en 2026 señalaba que los LLM estándar, sin recuperación multigiro, registran una precisión inferior al 10% en benchmarks de investigación multifase. Sin embargo, los agentes de Deep Research —sistemas que iteran en ciclos de búsqueda, lectura, síntesis y reconsulta— alcanzan más del 50%. Esta diferencia de cinco veces no es victoria de un solo truco, sino del bucle de investigación completo.
¿Qué constituye un bucle cerrado? Puede seguir ocho fases (Objetivo → Planificación → Búsqueda → Razonamiento → Nueva búsqueda → Herramienta → Acción → Verificación) o contraerse en cinco (Planificación → Búsqueda → Razonamiento → Refinamiento → Conclusión). Yo empleo ambos esquemas: el primero para tareas complejas de largo recorrido (investigación corporativa, due diligence interdisciplinaria) y el segundo para ciclos de investigación cotidianos. Si en cualquier punto intermedio se produce un error, los pasos posteriores se superpondrán sobre esa base errónea.
这也意味着搜索基础设施和上层Agent需要分别理解。Tavily、EXA、Elasticsearch、OpenSearch、Brave Search和Browser Search都可以作为Retrieval Provider(检索来源服务)。真正的产品层则负责Intent(意图理解)、Planning(规划)、Source Strategy(来源策略)、Reasoning(推理)、Evidence(证据评估)、Evaluation(质量评估)和Action(行动执行)。
在我们的实施经验中,有一个典型的反面案例:一家银行将“搜索增强”误解为“换一个更智能的搜索引擎”。结果,Agent在首批检索到的文档中就获得了一份看似权威的旧政策,没有触发补充搜索,最终引用了一份已废除的两年前风控规则。系统运行看起来很顺畅,决策者也未发现问题。直到一次审计发现了引用来源,才发现整个Research Loop缺少Evidence Age(证据时效)、Conflict Resolution(冲突解决)和Source Authority(来源权威)三层判断。
Extender la evaluación de la calidad de búsqueda de “si la recuperación es relevante” a “si todo el ciclo de investigación es confiable” — esto es lo que más he enfatizado a mis clientes durante este año.
三、Memory determina si un Agent puede funcionar a largo plazo
En el foro de Agentic Search, Memory se ha tratado como un tema independiente, incluyendo Long-term Memory, Task Memory y Context Compression.
Esto es muy razonable. En cuanto la tarea pasa de “una pregunta y una respuesta” a un proceso de investigación que dura decenas de pasos, el sistema inmediatamente se encuentra con un problema: ¿puede recordar de manera confiable qué se ha consultado, verificado y refutado anteriormente?
MemGPT propuso en 2023 el paradigma “LLM as OS”, cuyo núcleo es stratificar la memoria: el core memory dentro de la ventana de contexto, una capa de almacenamiento fuera de la conversación, y el archival memory recuperable. Letta lo ingeniería en 2024, y DeepLearning.AI lo ofreció como un curso corto en 2026. Esta línea tiene trabajos previos claros que se pueden citar, no son términos que nosotros hayamos creado.
Si una tarea de investigación repite continuamente la búsqueda de la misma información, se desperdiciará una enorme cantidad de costos. Lo más peligroso es que olvide que anteriormente descubrió que cierta fuente no era confiable, y luego la cite nuevamente.
Por lo tanto, la memoria de tareas (Task Memory) debe registrarse de forma estructurada. Al concluir cada tarea de investigación, el sistema debe guardar de manera persistente los siguientes campos:
- Plan de consulta: En cuántas subpreguntas se desglosó esta tarea y cuál es el objetivo de cada una.
- Lista de fuentes: Qué fuentes se consultaron en cada subpregunta, su nivel de autoridad, fecha de publicación y si están en desuso.
- Instantánea de evidencia: Los datos clave extraídos de cada fuente, con la referencia original y el fragmento del texto.
- Marcadores de conflicto: Qué fuentes presentan conclusiones contradictorias, en qué difieren, cuál fue la seleccionada por el sistema y por qué.
- Conclusión por etapas: El juicio provisional del sistema sobre la cuestión actual tras cada ciclo de búsqueda.
- Rutas fallidas: Qué trayectorias de búsqueda no arrojaron resultados, por qué y si vale la pena repetirlas en el futuro.
- Juicio final: ¿El usuario aceptó o rechazó la conclusión y cuáles fueron sus razones?
Anteriormente, muchos equipos solían utilizar una base de datos vectorial (Embedding + Retrieval, es decir, convertir el texto a vectores y buscar por similitud) para Memory. Guardaban todos los registros de chat tras hacerles Embedding y, en la siguiente consulta, recuperaban los fragmentos relevantes. Este enfoque presenta dos riesgos: en primer lugar, los «fragmentos relevantes» pueden no ser realmente pertinentes, lo que incrementa la probabilidad de que el modelo se vea afectado por ruido; en segundo lugar, gran cantidad de fragmentos carecen de etiquetas estructurales, lo que impide gestionar versiones, orígenes y fechas de caducidad. Lo que Memory realmente necesita es un diseño de acumulación, evaluación y estructuración; de lo contrario, a medida que Context se acumula cada vez más, la siguiente decisión se vuelve aún más incierta.
4. Lo verdaderamente valioso de la auto‑evolución: convertir la experiencia exitosa en Skill
En la demostración también se mostró Agent Swarm (coordinación de múltiples agentes) y el ciclo cerrado de «auto‑evolución». Esta forma de expresarse puede hacer pensar que el modelo se entrena a sí mismo. Una interpretación más precisa es que, tras finalizar una tarea, el Agent, mediante evaluación, retroalimentación humana y verificación de resultados, acumula métodos valiosos en Memory, Knowledge y Skill.
Por ejemplo, tras realizar 20 estudios consecutivos de oportunidades de producto, un sistema puede ir formando Product Opportunity Research Skill. Este Skill no es solo un fragmento de prompt; debe especificar:
- Trigger: qué tipo de tareas activarán este Skill
- Goal: cuáles son los criterios de éxito para esta investigación
- Context Schema: qué contexto empresarial es necesario precargar (marca, categoría, mercado objetivo)
- Constraints: qué fuentes no son confiables, qué datos no se pueden citar
- Tools: qué fuentes de búsqueda, API y bases de datos se invocan en orden
- Workflow: secuencia de pasos (primero identificar puntos de entrada al mercado → luego encontrar competidores principales → después revisar precios, tráfico y reseñas de usuarios → finalmente consultar Reddit y foros de quejas)
- Source Priority: priorizar fuentes de autoridad (informes financieros/anuales), después comunidades, y por último blogs
- Verification: qué evidencia es suficiente para respaldar que “existe demanda”
- Output Schema: qué campos se generarán al final y cuál es el formato de dichos campos
Es necesario aclarar al lector que este conjunto de campos Skill no equivale a OpenAI Function Calling (que registra funciones externas como interfaces JSON Schema invocables por el modelo) — esto es un protocolo a nivel de herramientas; tampoco es Anthropic Tool Use (similar a Function Calling, pero Anthropic utiliza tipos de mensaje más finos tool_use/tool_result) — también se mantiene en el nivel de herramientas. La Agent Spec de AutoGen estandariza la descripción de las capacidades del agente en objetos serializables, solapándose solo parcialmente con Skill. El verdadero objetivo de Skill es servir como plantilla de flujo de trabajo que el equipo ha acumulado tras decenas de prácticas reales, integrando los cuatro niveles: Tools, Workflow, Constraints y Verification — algo que ninguna de las capas de protocolo de OpenAI, Anthropic ni AutoGen cubre.
Al realizar este tipo de investigación por 21.ª vez, ya no será necesario reinventar el método. Ese es el verdadero valor compuesto de Skill.
慢慢学AI(005):Skill 是怎么炼成的
我在给一家连锁零售品牌做 AI 转型陪跑时,亲眼见过这个过程的演化。第一周 Agent 做竞品调研时,每个产品经理都要重新指导搜索路径、来源优先级、判断标准。到第三周,我们把每一轮”有效”的研究路径提炼进 Skill,做错的那几条(比如过度依赖单一数据源)被明确标记。第八周时,新加入的产品经理只要把目标扔进系统,产出的调研报告质量已经稳定高于第二周时最资深成员的初稿。注:三档时点的演化是示意性过程描述,具体节奏因项目而异。
这就是 Skill 真正的价值:把分散在团队不同人脑里的隐性方法,沉淀成团队共享、可继承、可改进的工程资产。
真正的自进化因此依赖 Evaluation(质量评价)。如果没有明确的结果评价,错误经验也会被保存,系统只会越来越自信地重复错误。
五、SEO 没消失,但漏斗多了一截
过去做 SEO,最典型的漏斗是 Ranking → Impression → Click → Signup → Paid。生成式搜索出现以后,用户可能在搜索页面、ChatGPT、Perplexity 或其他 Agent 中直接获得答案,不再点击每个来源。
Pew Research Center realizó un seguimiento de 68,879 búsquedas reales realizadas por 900 adultos estadounidenses en Google durante marzo de 2025, y descubrió que cuando aparecían resúmenes de inteligencia artificial en los resultados de búsqueda, solo el 8% de los usuarios hacían clic en los resultados tradicionales; sin resúmenes de IA, esa proporción era del 15%. Casi la mitad de los clics se vieron reducidos.
Esto amplía el valor del contenido de “obtener clics” a “convertirse en evidencia que los modelos están dispuestos a citar y en la que confían”. En las métricas operativas se incorporará gradualmente un nuevo flujo:Visibilidad de IA → Citación/Mención → Tráfico derivado de IA → Leads cualificados → Registro → Pago.
Esta cadena se analiza en cuatro niveles: visibilidad, citación, clics y conversión. La AI Visibility es la base: si tu marca o producto aparece en las respuestas que genera la IA. Citation/Mention se refiere a cuántas veces se te cita, en qué contexto y con qué precisión. AI Referral mide si los usuarios llegan a tu sitio web a través de esas citas y cuánto tráfico de calidad generan. Qualified indica cuántos de esos visitantes se registran, prueban el producto o solicitan información. Al final, todo se traduce en Signup y Paid.
Los datos de referencia que maneja el sector GEO son los siguientes: la tasa de citación en Perplexity alcanza el 97%, en Google AI Overviews es del 34% y en ChatGPT del 16%. El tráfico procedente de IA representa aproximadamente el 1,08% del total de visitas a sitios web, pero la tasa de conversión del tráfico de Perplexity supera entre 3,1 y 4,4 veces la del búsqueda orgánica de Google, y el tiempo de sesión es 4,7 veces mayor. Ambas cifras son de primer orden de magnitud: los números exactos varían según el sitio y el sector, pero la tendencia de que “el tráfico de IA es reducido pero de alta calidad” se mantiene firme.
Aprende IA Poco a Poco
La principal diferencia con el embudo SEO tradicional es que ahora se intercalan dos nuevas fases: Citation/Mention y AI Referral. Además, la calidad de la citation supera en importancia a la cantidad. Que un producto sea mencionado en una respuesta de IA como “otra alternativa posible” o como “uno de los tres productos más recomendables para este caso de uso” genera flujos de tráfico cualificado radicalmente distintos. Los datos de Ahrefs revelan que las fuentes citadas por Google AIO presentan aproximadamente un 45% de variación en cada ciclo de actualización, lo cual indica que ser mencionado una sola vez no basta: lo que verdaderamente importa es la Citation Persistence, es decir, la persistencia de esas menciones a lo largo del tiempo.
在此需要澄清一个常见的误区. La propia citation puede convertirse en un Vanity Metric si no se traduce en resultados tangibles. Cuando una marca acumula menciones en múltiples respuestas de IA pero ello no se traduce en visitas de calidad, búsquedas de marca, registros ni ingresos, el valor comercial de esas menciones es limitado.
Por lo tanto, GEO debe regresar al embudo completo, aunque los criterios de evaluación en cada etapa han evolucionado: ya no se busca ser “encontrado en la búsqueda”, sino ser “confiable para la IA hasta el punto de que esté dispuesta a recomendarlo”.
Seis. La creación de contenido como base de evidencia sólida para el espacio problemático, más allá de la escritura por palabras clave
正文结束
慢慢学AI<032>
El SEO tradicional se organiza fácilmente en torno a keywords para crear matrices de contenido: una palabra clave por página, con el objetivo de posicionar, capturar búsquedas长尾 y obtener enlaces externos.
Con la búsqueda agentiva (Agentic Search), el contenido sigue necesitando cubrir las intenciones de búsqueda, pero su estructura se acerca más al espacio de los problemas. Un agente puede plantear consecutivamente múltiples subpreguntas durante una tarea de investigación y comparar distintas fuentes. Requiere información que sea clara, verificable, estructuralmente estable y con fuentes rastreables.
Esto significa que la construcción de contenido, además de considerar keywords, debe establecer estabilidad en cinco dimensiones: entidades (Entity) definidas, hechos (Fact) verificables, fechas (Date) etiquetadas, fuentes (Source) trazables y cobertura topical (Topical Coverage) completa. En otras palabras, las tácticas de antaño —apilar páginas de baja densidad para posicionar— quedan invalidadas con la llegada de los agentes.
慢慢学AI<009>——GEO时代的引用优化
实体优先:文档级内容属性如何主导AI引用
Al investigar, los Agent prefieren páginas con entidades claras, hechos verificables, fuentes definidas y temas completos, en lugar de páginas internas que repiten la misma palabra clave tres veces en el título. Lo que demuestra el benchmark GEO-Bench (utilizado en FeatGEO, documento del ACL 2026) es que los atributos de contenido a nivel de documento—estructura, contenido y lenguaje—tienen mucho más impacto en la tasa de citas que las ediciones dispersas a nivel de palabras clave.
Añadir la fuente original a cada afirmación factual, agregar ventanas temporales a cada cifra y establecer conexiones explícitas entre los temas de diferentes páginas: estas prácticas que el SEO tradicional no consideraba prioritarias se han convertido en acciones fundamentales en la era del GEO.
La confianza del contenido genera valor sostenible
Un sitio que produce de forma consistente contenido confiable para la IA en un área específica adquiere mayor valor tanto en la era de las búsquedas tradicionales como en la de los Agent.
Caso verificado en el sector manufacturero B2B
Durante el desarrollo de estrategias de contenido para varios clientes del sector manufacturero B2B, he confirmado esta premisa. Un cliente especializado en automatización industrial reorganizó todos sus manuales de productos,论文行业 y informes blancos de los últimos tres años siguiendo cuatro dimensiones: entidad—hecho—fecha—fuente. Además, implementó un mapa temático a nivel del sitio. Los resultados tras seis meses fueron notables: la tasa de citas de sus páginas de productos en las respuestas principales de IA se triplicó, y los Qualified Leads cualificados aumentaron aproximadamente un 40%.
Nota: Estas cifras tienen carácter orientativo. Proceden de una revisión anonimizada del proyecto y varían según el sector, el punto de partida y la profundidad de ejecución. No constituyen datos públicos reproducibles ni exactos.
Siete、Las API de búsqueda se convierten cada vez más en la capa de infraestructura de los Agent
Para los desarrolladores, este cambio también tiene una implicación a nivel de ingeniería.
En adelante, no debería considerarse la “búsqueda” como una capacidad de producto aislada y construida de forma independiente. Una arquitectura más racional分成三层:
Primera capa, Search Infrastructure. Esta capa constituye una base de recuperación (retrieval) independiente del proveedor, que gestiona las claves, cuotas, costos, estabilidad, caché, enrutamiento y estrategias de degradación (fallback) de diferentes proveedores (Tavily, EXA, Brave, Google, Bing, OpenSearch, Elasticsearch, y sistemas de recuperación propios). Su interfaz es una “recuperación + retorno de evidencias” unificada, en lugar del SDK (Software Development Kit) de un proveedor específico.
Esta capa mantiene una relación de paralelismo con la arquitectura clásica del RAG (Retrieval Augmented Generation) de cinco niveles — “Document Store / Retriever / Generator / Reranker / Prompting Strategy” — pero sin coincidir totalmente. La diferencia clave radica en que el RAG sigue el paradigma de “pregunta y respuesta en una sola pasada”, mientras que la Search Infrastructure opera bajo un paradigma de “múltiples llamadas de Agent y拼接dinámica de resultados”. Mezclar ambos enfoques suele generar confusión en cuanto al Reranker y la Prioridad de Fuentes.
Segunda capa: Research Agent. Esta capa se encarga de las siguientes funciones: Planning (planificación), Query Expansion (expansión de consultas), Retrieval (recuperación), Reasoning (razonamiento), Evidence Assessment (evaluación de evidencias), Verification (verificación) y Action Orchestration (orquestación de acciones). En lugar de invocar directamente al Provider, obtiene los candidatos de evidencia a través de la abstracción unificada de la primera capa, y posteriormente decide qué evidencias resultan confiables y cuáles presentan conflictos que requieren búsquedas complementarias.
Tercer nivel, Domain Skill. Para diferentes tareas como SEO Research, Competitor Research, Academic Research, Product Research y Legal Research, se consolidan métodos específicos, priorización de fuentes, reglas de verificación y esquemas de salida (Schema). Skill invoca a Agent, que a su vez invoca a Infrastructure.
Esta estructura por niveles ofrece un beneficio asimétrico: el Provider de nivel inferior puede reemplazarse. Si Tavily presenta problemas, se puede conmutar temporalmente a EXA, sin que el lado de negocio tenga que reescribir el Research Loop por un cambio en la capa inferior. Por otro lado, las capacidades de la capa superior siguen acumulándose, por lo que el equipo de negocio no necesita reescribir Skill cuando se cambia de Provider. Este es el valor real del enfoque por niveles: el desacoplamiento.
El año pasado, un equipo de IA de un cliente del sector financiero probó esta arquitectura, reorganizando la búsqueda que antes consistía en «cada equipo de ingeniería conecta su propia API» en estos tres niveles. Como resultado, los equipos de ingeniería ya no se ven interrumpidos por «un Provider que de repente limita el caudal», y los equipos de negocio pueden describir directamente qué investigación necesitan mediante Skill, sin tener que preocuparse por cuál Provider se está utilizando en el nivel inferior. En un plazo de tres meses, el tiempo de entrega de las tareas de investigación transversales entre equipos se redujo aproximadamente a la mitad. Nota: La reducción a la mitad proviene de una revisión direccional de un proyecto anonimizado; el factor concreto varía según el tamaño del equipo y la estructura previa.
VIII. El verdadero cambio es que la “obtención de información” se incorpora a la ejecución de tareas
Si solo se interpreta AI Search como “un buscador más inteligente”, se estará subestimando este cambio de paradigma.
Cuando Search, Memory, Tool Use y Action se integren en un sistema unificado, lo que los usuarios realmente soliciten se parecerá cada vez más a objetivos concretos, mientras que Query pasará a formar parte de los procesos internos.
“Ayúdame a buscar algunos artículos sobre este tema” evolucionará hacia “Investiga este mercado, compara las alternativas disponibles y preséntame evidencias junto con recomendaciones”. “Busca un hotel” se transformará en “Encuentra el hotel adecuado bajo estas restricciones, compara el costo total y prepárate para completar la reserva”. “Revisa a la competencia” dará paso a “Monitorea continuamente a los competidores, notifícame cuando detectes cambios significativos y explícame cómo podrían afectar nuestra estrategia actual”.
Esta transformación adquiere matices distintos según la industria.
En el sector de telecomunicaciones, el Agent dejará de limitarse a responder “¿Cuál plan 5G es más económico?”. En su lugar, basándose en los patrones de llamadas, consumo de datos y uso de roaming del usuario, evaluará si su plan actual resulta conveniente, y antes del vencimiento del contrato ofrecerá proactivamente tres alternativas —renovar, cambiar de plan o migrar a otro operador—, enviando la comparación directamente al usuario.
En el sector financiero, el Agent ya no se conformará con explicar “¿Qué es un ETF?”. Bajo autorización del usuario, analizará su cartera de inversiones, las condiciones del mercado y los cambios en la normativa regulatoria, proporcionando sugerencias proactivas de rebalanceo de activos y respaldando cada recomendación con las fuentes correspondientes.
En el ámbito manufacturero, un Agent ya no se limita a buscar códigos de error de una máquina. En su lugar, parte de los logs de equipos, datos de sensores y registros de mantenimiento recientes para diagnosticar las causas de las fallas mediante análisis cruzado. Además, genera planes de mantenimiento en tres niveles — para hoy, mañana o este fin de semana — y produce directamente órdenes de trabajo con listas de repuestos y estimaciones de horas-hombre. Este tipo de escenarios representa el caso más convincente para la implementación de Agents industriales en 2026: ante datos de vibración de una máquina CNC, tres meses de registros de mantenimiento y alertas de sensores del turno actual, una inspección manual requeriría 4 horas, mientras que un Agent de múltiples iteraciones con cadenas de evidencia proporciona tres opciones de solución en apenas 8 minutos, cada una respaldada por las fuentes de evidencia correspondientes.
En el sector电商 (comercio electrónico), un Agent ya no se limita a buscar precios de competidores. Más bien, monitorea continuamente precios, inventario y ritmos promocionales en toda la plataforma, y cuando un SKU relevante para el usuario presenta un precio inferior al promedio histórico de los últimos 30 días en un 20%, envía una notificación proactiva y sugiere si ajustar o no los propios precios.
La búsqueda sigue existiendo, pero retrocede a un papel más amplio dentro de sistemas de tareas más grandes.
Para contenidos, SEO y productos de IA, lo verdaderamente值得关注的 (lo que merece atención real) es precisamente este punto: quién puede generar evidencia fiable de forma continua, quién es capaz de convertir la recuperación de información en citas verificables, y quién puede transformar esas citas en acciones concretas.
Implicaciones para los tomadores de decisiones
Si usted es un directivo de primer nivel o un vicepresidente a cargo de la digitalización, lo verdaderamente crítico para implementar Agentic Search no es “qué API de búsqueda cambiar”, sino tres aspectos fundamentales:
Infraestructura de evidencia — ¿Tus manuales de producto, informes sectoriales, whitepapers y registros de atención al cliente están estructurados según las cuatro dimensiones de “entidad—hecho—fecha—origen”? Esta es la premisa fundamental para que un agente pueda citarlos de forma sostenida en el tiempo, y no algo que una herramienta SEO pueda reemplazar.
Activos de Skills — ¿Ese conocimiento tácito que reside en la mente de tus empleados más experimentados —el de “cuando ocurre X, se hace Y”— se ha volcado en Skills reutilizables y mejorables? Si no es así, cada iniciativa de IA comienza desde cero.
Ciclo de evaluación — ¿Con qué criterios determinas si la salida de la IA es correcta o incorrecta? Sin un mecanismo de Evaluación que permita la autoevolución, el sistema solo repetirá los errores con creciente confianza.
Lo que tienen en común estos tres elementos: ninguno aparece en una lista de compras, todos residen en el interior de la organización.
Preguntas frecuentes
P1: Con la aparición de Agentic Search, ¿es necesario seguir invirtiendo en SEO tradicional?
No exactamente. El SEO constituye la base del GEO. Si un sitio web ni siquiera figura en las búsquedas convencionales, las probabilidades de ser citado por una IA son aún menores. El SEO se enfoca en “ser localizable”, mientras que el GEO busca “ser lo suficientemente confiable para que una IA esté dispuesta a parafrasearlo”. Son dos objetivos distintos, no una relación de substitución.
P2: El volumen de Citations ha aumentado, ¿por qué no crece el número de Qualified Leads?
Muy probablemente el problema sea de calidad en la Citation. Que en una respuesta generada por IA seas simplemente «una alternativa más» frente a ser «una de las tres opciones más值得评估的» genera flujos de tráfico de naturaleza completamente distinta. Lo primero constituye merasvisualizaciones; lo segundo equivale a consultas calificadas. Analizar en qué posición y dentro de qué contexto aparece tu Citation en la respuesta de IA resulta mucho más revelador que fijarse exclusivamente en los números.
P3: ¿Conviene construir un Research Agent propio desde ya?
Empecemos por delimitar el alcance del problema. Si tus tareas de investigación requieren acceso a datos de dominio privado —perfiles de clientes, manuales internos de producto, registros de cumplimiento normativo— y además implican reconciliación de cumplimiento o interpretación regulatoria, la construcción propia es inevitable. En cambio, si las tareas de investigación se basan principalmente en información pública, lo recomendable es sacarle el máximo provecho a las herramientas disponibles en el mercado (Tavily / EXA / Perplexity / 阿里云 OpenSearch Agentic Search, entre otras) durante un período de observación de 3 a 6 meses, y solo entonces decidir si conviene descender a una solución自行建造.
Autoverificación inversa (para no engañarse a uno mismo)
- Convertir las “citas de IA” en un KPI sin把它们当作工具——si esas citas no se traducen en registros o consultas, estamos ante métricas superficiales.
- Tratar la acumulación de Skills como un ejercicio de documentación puntual——sin Evaluation, los Skills solo consolidan errores.
- Reducir la búsqueda por API a un problema de ingeniería——evaluar la calidad de búsqueda es, en esencia, un problema de confiabilidad en ciclos de investigación, no solo de selección de interfaces.
- Usar el “volumen de tareas realizadas por IA” como evidencia——lo que realmente importa es “qué cambió en el sistema gracias a ello”.
Si estás evaluando cómo tu equipo de búsqueda empresarial o SEO puede abrazar el Agentic Search, qué métricas de GEO vale la pena monitorear o qué activos de contenido se convertirán en objeto de citas por IA, charlemos. Somos consultores especializados en transformación empresarial con IA —desde arquitectura de búsqueda y estrategia de contenidos hasta métricas de GEO— para ayudarte a pasar de “que encuentren tu página web” a “que la IA confíe en ti lo suficiente como para citartu”.
- Capacitación corporativa —Convertir la arquitectura de búsqueda, los activos de contenido y las métricas de GEO en un taller práctico para tu equipo (2-3 días, teoría + práctica).
- Consultoría especializada —Diagnóstico y hoja de ruta adaptada a tu infraestructura de búsqueda actual, ruta de acumulación de Skills y calidad de Citation.
- Charlas directivas y ponencias sectoriales —Llevar conceptos como las tres fases de búsqueda, el contenido como espacio problemático o el embudo de GEO a tu conferencia sectorial o reunión ejecutiva.
Correo de colaboración: [email protected]
Lectura complementaria: Marco de siete pasos para la transformación con IA, que explica de manera sistemática la ruta completa para implementar IA en empresas.
Sobre esta serie
云栖观察 (Observaciones de Yunqi) es la serie de análisis in situ de IAIUSE, basada en la Yunqi Conference 2026. Desde la perspectiva de un investigador, desglosa los cambios reales que están ocurriendo en la industria de la IA: sin perseguir tendencias, solo evaluando las direcciones en las que vale la pena invertir y la solidez de las evidencias.
La serie abarca temas como la capa de sistemas sobre los modelos fundamentales, la implementación de Agents, los activos de Context, el diseño organizacional de IA empresarial y la migración de las unidades competitivas de productos de IA. En total, unos 10 artículos.
Cuento con casi 8 años de experiencia en consultoría y análisis de negocios para grandes empresas, habiendo trabajado en IBM en proyectos relacionados con telecomunicaciones, finanzas, seguros y manufactura. Posteriormente, he continuado en primera línea de productos de operadores, productos de internet y desarrollo de aplicaciones de IA, ocupándome de análisis de requisitos, diseño de productos y ejecución transversal entre equipos. Detrás de este公众号 hay en realidad un pequeño equipo —yo y 1-2 colegas con quienes llevo tiempo collaborating— que nos dividimos la investigación sobre herramientas de programación de IA, la revisión de casos de gobernanza organizacional y las conversaciones de coaching. La mayoría de los proyectos donde “hemos acompañado a las empresas en el proceso” son entregas conjuntas de nuestro grupo.
Los juicios de esta serie provienen de mis observaciones in situ y de la validación cruzada con la industria; reflejan una postura autoral definida y no representan los puntos de vista de ningún proveedor.
Puntos clave de localización (referencia multilingüe, convenio IAIUSE 2026-08-09)
Al traducir a 19 idiomas, el contenido siguiente se sustituye según la localización del mercado objetivo, manteniendo la estructura y la presentación visual intactas:
| 中文稿内容 | 英文版 | 日文版 | 德文版 | 阿拉伯版 | 西班牙语版 |
|---|---|---|---|---|---|
| 阿里云 OpenSearch | Alibaba Cloud OpenSearch(保留) | アリババクラウド OpenSearch | Alibaba Cloud OpenSearch | OpenSearch علي بابا كلاود | OpenSearch de Alibaba Cloud |
| Tavily / EXA | Tavily / EXA(全球性产品保留) | Tavily / EXA | Tavily / EXA | Tavily / EXA | Tavily / EXA |
| ChatGPT / Perplexity | ChatGPT / Perplexity | ChatGPT / Perplexity | ChatGPT / Perplexity | ChatGPT / Perplexity | ChatGPT / Perplexity |
| 百度 / Google | Yahoo! JAPAN / Google |
| 中国电信 / 移动 / 联通 | AT&T / Verizon / T-Mobile | NTT / KDDI / 软件銀行 | Deutsche Telekom / Vodafone | STC / Etisalat |
|---|---|---|---|---|
| 飞书 / 钉钉 | Slack / Teams | Slack / Teams / Lark | Slack / Teams | Microsoft Teams |
| Tavily / Exa(casos originales) | Tavily / Exa(casos originales) | Tavily / Exa(casos originales) | Tavily / Exa(casos originales) | Tavily / Exa(casos originales) |
| 招商银行 / ICBC | JPMorgan Chase / Bank of America | 三菱UFJ / 三井住友銀行 | Deutsche Bank / Commerzbank | National Commercial Bank(Arabia Saudí)/ QNB |
| Marcas de retail en cadena (anonimizado) | Target / Best Buy (anonimizado) | Aeon / Seven & i (anonimizado) | Lidl / Aldi (anonimizado) | Panda / Al Othaim (anonimizado) |
| Clientes de automatización industrial (anonimizado) | Honeywell / GE (anonimizado) | Fanuc / Yaskawa (anonimizado) | Siemens / Bosch (anonimizado) | SABIC / Aramco (anonimizado) |
| Clientes financieros (anonimizado) | JPMorgan / Goldman (anonimizado) | Mitsubishi UFJ / SMBC (anonimizado) | Deutsche Bank (anonimizado) | NCB / QNB (anonimizado) |
Nota: Aparte de los elementos de localización mencionados anteriormente, los productos y conceptos globales en el artículo (Research Agent, Task Memory, Context Provider, Citation / Mention, AI Visibility, Long-term Memory, MemGPT, Letta, RAG, Tavily, EXA) se mantienen en su forma original sin traducir. Los demás 15 idiomas siguen la ejecución en tres niveles de IAIUSE: los 5 idiomas principales (chino, inglés, alemán, japonés, árabe) se localizan según la tabla anterior; los 9 idiomas adicionales (español, francés, portugués, coreano, ruso, italiano, neerlandés, polaco, turco) conservan los nombres originales de OpenSearch / Tavily / EXA y sustituyen las empresas representativas locales; los 5 idiomas opcionales (sueco, tailandés, vietnamita, ukrainio, indonesio) conservan los nombres originales como marcadores de posición.
Referencia de citas (por ítem, acuerdo del 2026-08-09, punto 1 de verificación obligatorio)
| # | 文中引用 | 来源 | 发布日期 | 证据层级 | 立场标注 |
|---|---|---|---|---|---|
| 1 | “Exa 81% / Tavily 71% en el benchmark multi-salto WebWalker; latencia p95 Exa 1.4s / Tavily 4.5s” | exa.ai/versus/tavily (página oficial de comparativa de Exa Labs) | 2026-02-12 | Hecho verificado (fuente del proveedor) | Página propia de Exa, con posicionamiento de Exa; el benchmark de terceros WebWalker puede verificarse independientemente |
| 2 | “OpenSearch Agentic Search de Alibaba Cloud se comercializa a partir del 2026-08-31; antes en beta pública gratuita” | alibabacloud.com/help/doc-detail/3053142.html (documentación oficial de Alibaba Cloud OpenSearch) | 2026-08-31 (vigente) | Hecho verificado (documentación oficial) | Alibaba Cloud, posicionamiento del proveedor |
| 3 | “Los LLM estándar sin recuperación multiturno tienen una precisión < 10%, mientras que los Deep Research Agent superan el 50%” | tianpan.co/blog/2026/04/12/deep-research-agents… (análisis sectorial); consúltese también arxiv.org/html/2606.15367v1 (revisión S1-DeepResearch) | 2026-04 | Observación sectorial (revisión analítica) | Análisis independiente de Tianpan; revisión por pares del artículo S1-DeepResearch |
| 4 | “MindDR obtiene 45,7% en BrowseComp-ZH / 52,5% en DeepResearch Bench” | arxiv.org/html/2604.14518v1 (Informe Técnico Mind DeepResearch de Li Auto) | 2026-04-14 | Hecho verificado (artículo) | Modelo propietario de Li Auto; posición del fabricante |
| 5 | “DRBench: 100 tareas de investigación empresarial profunda, 1093 subpreguntas, 10 dominios” | arxiv.org/pdf/2510.00172(ServiceNow Research) | 2025-10 | Hechos verificados (artículo) | Investigación propia de ServiceNow |
| 6 | “MemGPT 2023 artículo ‘LLM as OS’ paradigma en capas; Letta 2024 ingeniería; DeepLearning.AI 2026 curso corto” | blog.stackademic.com/letta-platform… ;letta.com/blog/benchmarking-ai-agent-memory;linkedin.com/posts/deeplearningai… | 2023-2026 | Hechos verificados (revisión técnica) | Blogs propios de MemGPT/Letta, con perspectiva del proveedor |
| 7 | “Pew Research: 900 adultos estadounidenses, 68.879 búsquedas en Google; tasa de clics del 8% con resúmenes de IA frente al 15% sin ellos” | instituteforpr.org/do-ai-summaries-reduce-clicks-on-google (resumen de Pew Research) | 2025-07 | Hecho verificado (investigación independiente) | Pew Research, institución independiente |
| 8 | “Perplexity con tasa de citación del 97%, Google AIO 34%, ChatGPT 16%; el tráfico AI representa aproximadamente el 1,08% del tráfico total de sitios web, con tasas de conversión 3,1-4,4 veces superiores a la búsqueda orgánica de Google y tiempos de sesión 4,7 veces mayores” | cite.solutions/generative-engine-optimization(2026-05-02);omnius.so/blog/generative-engine-optimization-kpis-and-metrics(2026-08-18);trycited.app/generative-engine-optimization(2026-08-17) | 2026-05/08 |Observación del sector (datos de múltiples proveedores de herramientas GEO);Citación MarGen 2026 | Datos propios de proveedores de herramientas GEO, con posicionamiento del proveedor |
Learn AI Slowly
| # | Título | Fuente | Fecha | Tipo de fuente | Posición |
|---|---|---|---|---|---|
| 9 | “Ahrefs: Fuentes citadas por Google AIO aproximadamente 45% por cada ciclo de cambios” | omnius.so/blog/generative-engine-optimization-kpis-and-metrics(2026-08-18) | 2026-08-18 | Observación sectorial (proveedor de herramientas SEO) | Ahrefs, postura del proveedor de herramientas SEO |
| 10 | “FeatGEO: GEO-Bench pruebas cruzadas en tres motores generativos, el impacto de los atributos de contenido a nivel de documento sobre la tasa de citas es mayor que las ediciones a nivel de palabras clave” | aclanthology.org/2026.acl-long.929/(Artículo largo ACL 2026) | 2026 | Hecho verificado (revisión por pares) | Investigación académica |
| 11 | “Gemini 3.1 obtiene RACE 49.65 y precisión de citas 77.20% en DeepResearch Bench” | arxiv.org/html/2604.14518v1(Documento MindDR incluye comparativas de diferentes proveedores) | 2026-04 | Hecho verificado (paper) | Benchmark de terceros, posición no neutral |
| 12 | “RAG clásico de cinco capas: Document Store / Retriever / Generator / Reranker / Prompting Strategy” | medium.com/@angelosorte1/rag-architectures-every-ai-developer-must-know-in-2026 (resumen de Angelo Sorte); levelop.dev/blog/…/agent-rag-architecture-five-layer-retrieval-stack (2026-07-23); braintrust.dev/articles/best-vector-databases-for-rag-2026 | 2026 | Análisis del sector (revisión técnica) | Resumen de la práctica de ingeniería |
| 13 | “Anthropic Agent Skills: recursos a nivel de sistema de archivos, carga de Skills bajo demanda, combinables” | docs.anthropic.com/en/docs/agents-and-tools/agent-skills/overview (documentación oficial de Anthropic) | 2026 | Hechos verificados (documentación oficial) | Anthropic, posición del proveedor |
Casos de clientes marcados en el texto como “desidentificados/ilustrativos” (evolución de marca de retailChain, cliente de automatización industrial B2B con tasa de cite 3×/incremento de 40% en Qualified Leads, cliente financiero con tiempo de entrega reducido a la mitad): provienen de revisiones desidentificadas de proyectos de acompañamiento, no指向 ningún cliente específico, las cifras son orientativas.




