--- type: MI asset_id: MI-EL-WORXOS-Metodologia-Benchmark-v01 version: v01 status: Draft · benchmark citado · insumo F1 del room de Metodología owner: Victor Heredia sherpa: Jay ratificador: Victor Heredia intellibank: IB-EL-EmpowerLabs subbank: PB-EL-Project-Bank/PB-WORX-Worx proposito: > Benchmark 2026 (deep-research) de metodologías de colaboración humano-agente, para diseñar el "WORX Way": el modo de trabajo de humanos + agentes de distintas jerarquías sobre la Capa de Coordinación. Insumo directo del pack TP-EL-WORXOS-MetodologiaColaboracion-Fable-v01. gate_g0: PASS relacionado: ARQ-EL-WORXOS-CapaCoordinacion-v01 · TP-EL-WORXOS-MetodologiaColaboracion-Fable-v01 fecha_creacion: 2026-07-12 tags: [MI, benchmark, metodologia, human-ai-teaming, worx-way, colaboracion, agentes, citado] --- # Benchmark 2026 · Metodología de Colaboración Humano-Agente ## Qué adoptamos para el "WORX Way", con la Ley #0: la inteligencia manda, la tecnología sigue > **Hallazgo marco (lo confirma cada fuente):** el diseño converge en poner el **juicio humano arriba** y a los agentes **abajo ejecutando** — el humano se mueve *"above the loop"*. Y el bloqueo real NO es la tecnología: **Deloitte reporta que 84% de las empresas no ha rediseñado el trabajo** para la IA, y **BCG afirma que el éxito es "70% personas y gestión del cambio, no algoritmos"**. Es decir: **la brecha metodológica es el cuello de botella** — exactamente lo que estamos cerrando. ## 1 · Modelos operativos agénticos (roles + célula) - **"Above the loop"** (McKinsey): el humano deja de estar *en* el loop y pasa a diseñar el marco + supervisar; 3 roles emergentes: **supervisor en M** (orquesta agentes), **experto en T** (excepciones/calidad), **frontline aumentado**. → mapea a EmpowerTeamX. - **"Agent boss"** + escalera **Author → Editor → Director → Orchestrator** (Microsoft): cada nivel de colaboración humano-agente es un modo explícito; la org pasa de "humano con asistente" → "equipos humano-agente" → "humano-liderado, agente-operado". - **Célula = 2–5 humanos sobre 50–100 agentes** (McKinsey) / **agentic pod 3–5** (BCG). **La capacidad de supervisión humana es el techo** que limita cuántos agentes se pueden correr → *presupuesto de supervisión obligatorio por célula*. - **"Work chart" > org chart:** la organización se ordena por **outcomes**, no por funciones fijas. ## 2 · Clásicos como plantilla (qué transfiere) - **Scrum** (roles / eventos / artefactos / Definition of Done), **Kanban** (límites de WIP, flujo pull, clases de servicio), **Shape Up** (shaping, betting, appetite, ciclos), **holacracia/sociocracia** (círculos, gobierno vs. operación), **RACI/DACI** (mapa de responsabilidad). *(Referencias canónicas: Scrum Guide, Kanban/Anderson, Basecamp Shape Up, Agile Manifesto.)* - **Qué transfiere a equipos humano+agente:** roles explícitos, ceremonias de cadencia, límites de WIP, y **Definition of Done** (crítico: el DoD de un NEXT/frente). **Qué se rompe:** asumir que todos los "miembros" son humanos con el mismo tipo de rendición de cuentas — el agente actúa, el humano responde. ## 3 · Cultura remote-first / wiki (el linaje de Victor) - **Handbook-first / single-source-of-truth** (GitLab), **async + working-out-loud + written-first** (Automattic/Basecamp): la verdad se documenta una vez y vive en un lugar. - **Comunicación como responsabilidad individual** (no centralizada) — cada quien se hace responsable de comunicar y mantenerse comunicado. *(Principio de Victor, respaldado por la práctica remote-first.)* - **La evolución del principio wiki:** de *"todos editan el documento directamente"* → en la era agéntica se **invierte** a *"nadie toca el documento; todos dirigen a su SherpaX que escribe bajo gobernanza"*. La verdad sigue siendo única y compartida; cambia **quién ejecuta la escritura**. ## 4 · Protocolos de delegación y supervisión (el "cómo se dirige") - **Niveles de autonomía atados a reversibilidad, no a tipo de tarea:** A0 borrador · A1 aprobar-para-actuar · A2 actuar-y-registrar · A3 autónomo-con-escalación. **Toda acción fuera de la ventana de rollback baja a A1.** → valida directo los **L0–L3** del ARQ. - **Vocabulario tipado de interrupción: APROBAR / RECHAZAR (con razón) / EDITAR / RESPONDER** — es como ya funcionan los SDKs de agentes (OpenAI). **Coincide exactamente con el ARQ.** Cada intervención se registra (actor, verbo, antes/después). - **Delegación-por-brief:** cada hand-off lleva un *Agent Brief* (rol, objetivo, guardrails, criterios de aceptación, nivel de autonomía) + **contrato de escalación** por jerarquía: los interrupts de un sub-agente suben a su orquestador, no al humano top; lo de mayor impacto hace *four-eyes*. - **Calibración de confianza:** un agente **gana** nivel de autonomía tras superar un umbral de aceptación muestreado, y **lo pierde** ante un incidente. Anti over-trust (muestrear) + anti under-trust (promover con evidencia). Los "confidence scores" solos **no** calibran — pueden empeorar el over-trust. - **Bitácora de delegación + auditabilidad** (Singapore IMDA, ene-2026; EU AI Act Art. 14 = piso): cada delegación se registra; la cadena disparador→contexto→salida→decisión-humana→acción→rollback vive **fuera del contexto del modelo** (un agente "puede estar seguro y equivocado sobre sus propias acciones" — caso Replit jul-2025). ## 5 · Habilidades humanas + adopción (que no sea un PDF que nadie sigue) - **Las habilidades que importan (según los propios trabajadores, Microsoft WTI):** **control de calidad del output de IA (50%)** y **pensamiento crítico (46%)** — NO prompting. Más: spec-craft/delegación (definir el "done"), verificación (86% trata el output como borrador propio), **task-triage** (decidir humano-vs-agente *antes* de empezar), y **mantenimiento deliberado de habilidad** (trabajar sin IA a propósito para no des-aprender). - **La adopción depende más del sistema que del individuo:** factores organizacionales pesan **2×** el mindset individual (67% vs 32%); **líderes que modelan el uso** + **seguridad psicológica** son las palancas. - **Cómo pega y no muere en la semana 3:** gate por **competencia demostrada, no asistencia** (ADKAR: *Ability*, no *Knowledge*) — **el Rally WORX / Sellos de Validación ya hace esto** (valida evidencia antes de emitir el sello). Diseñar **Reinforcement** (el fallo #1 de ADKAR): reconocimiento + seguimiento + accountability visible. Codificarlo en **artefactos repetibles + Comunidad de Práctica + Centro de Excelencia** que sea dueño del estándar. - **Rituales como sistemas vivos:** evolucionar standups/demos; forzar que "un agente nuevo posea un entregable real end-to-end". ## Qué de esto ya tenemos (no partimos de cero) El ARQ de la Capa **ya implementa** el vocabulario tipado, los L0–L3, el Registro Agéntico (agent inventory) y el humano-sobre-el-loop → la metodología no los inventa, los **coreografía**. Y WORX ya trae las 5 Capacidades, los rituales-comando y el Rally (gate por competencia). El WORX Way = evolucionar eso a la era agéntica multijerárquica. ## Fuentes - McKinsey — The agentic organization: https://www.mckinsey.com/capabilities/people-and-organizational-performance/our-insights/the-agentic-organization-contours-of-the-next-paradigm-for-the-ai-era - Microsoft 2026 Work Trend Index (agent boss / Work Chart / skills): https://www.microsoft.com/en-us/worklab/work-trend-index/agents-human-agency-and-the-opportunity-for-every-organization - Microsoft WorkLab — Author→Editor→Director→Orchestrator: https://www.microsoft.com/en-us/worklab/ai-at-work-one-function-wrote-the-ai-playbook-the-rest-will-follow - BCG — agent-native operating model / pods: https://www.bcg.com/publications/2026/agent-native-marketing-operating-model · https://www.bcg.com/publications/2026/agentic-ai-turns-every-team-into-its-own-transformation-engine - Deloitte — agentic AI strategy (84% no rediseño): https://www.deloitte.com/us/en/insights/topics/technology-management/tech-trends/2026/agentic-ai-strategy.html - EU AI Act Art. 14 (human oversight): https://artificialintelligenceact.eu/article/14/ - OpenAI Agents SDK — human-in-the-loop (approve/reject/edit/respond): https://openai.github.io/openai-agents-python/human_in_the_loop/ - Trust calibration (paper): https://arxiv.org/pdf/2510.26518 - AI audit trails / Replit incident: https://www.metacto.com/blogs/ai-audit-trails-what-to-log-when-agents-touch-business-systems - Mollick — Management as AI superpower: https://www.oneusefulthing.org/p/management-as-ai-superpower - Prosci ADKAR (Reinforcement como fallo #1): https://www.prosci.com/blog/adkar-model - GitLab all-remote handbook: https://about.gitlab.com/handbook/ · Basecamp Shape Up: https://basecamp.com/shapeup - Singapore IMDA Model AI Governance Framework for Agentic AI (2026) · Scrum Guide: https://scrumguides.org > Nota: los frentes "clásicos (Scrum/Kanban)" y "remote-first" se completaron con fuentes canónicas estables + material parcial de la investigación (2 sub-agentes se cortaron por error de API); los otros 3 frentes traen citas primarias verificadas. ## CHANGELOG | Versión | Fecha | Cambio | |---|---|---| | v01 | 2026-07-12 | Benchmark deep-research (5 frentes) para el WORX Way. Hallazgos mapeados a roles/célula, clásicos, cultura remote-first/wiki, protocolos de delegación (que validan los L0–L3 y el vocabulario tipado del ARQ) y habilidades/adopción. |