--- type: WOI asset_id: WOI-EL-IBL-BenchmarkMetodologias-v01 version: v01 status: Borrador activo (preparatorio para documento canónico) owner: Victor Heredia sherpa_owner: Jay fecha_creacion: 2026-06-06 intellbank: IB-EL-EmpowerLabs / PB-EL-Project-Bank / PB-IBL-IntelligenceBasedLearning proposito: > Benchmark de metodologías de aprendizaje comparables (o potencialmente más poderosas) que IBT. Documento preparatorio: alimenta la redacción posterior del documento canónico de la metodología (MePB-EL-IBT-Metodologia). metodo: > Gate G0 (consulta vault: sin investigación comparativa previa) + investigación profunda en 5 ángulos paralelos con verificación de fuentes: ciencia del aprendizaje clásica · marcos pedagógicos de casos/problemas · mental models y decision education · AI tutoring 2023-2026 · medición invisible + programas cohort-based comerciales. referencias: - XP-EL-IBL-IntelligenceBasedLearning-v01 - BCS-NH-ArteSerPadres-PadreConsciente-v01 - MePB-XX-BrainCode-Anatomy-v02 --- # WOI — Benchmark de metodologías vs IBT ## Investigación preparatoria para el documento canónico · 2026-06-06 --- ## § 1 · Hallazgo central **Nadie combina los 6 elementos de IBT.** Cada elemento existe por separado, casi todos con evidencia que lo respalda — pero ningún marco académico ni producto comercial los integra. El elemento sin precedente identificado es la **medición de mindset por análisis de lenguaje conversacional**: es el diferenciador más defendible y, a la vez, el que más validación propia requiere. | Elemento IBT | ¿Existe afuera? | Quién se acerca más | |---|---|---| | 1. Instalar el stack cognitivo del practicante ideal | Sí, parcial | Illness scripts (medicina, con RCTs) · Cognitive Apprenticeship · CTA/ShadowBox (Klein) | | 2. Espiral de casos primero, teoría después | Sí | PBL (McMaster) · Case Method (HBS/Langdell) · Minerva | | 3. Artefacto cognitivo propio como entregable | Solo organizacional | Building a Second Brain / Life OS (artefacto de notas, no cognitivo) | | 4. Tutor IA 24/7 con RAG del ideal + memoria del aprendiz | Parcial, nadie con ambos BCs | Harvard/Kestin (RAG sin memoria) · Squirrel AI (memoria sin corpus experto) · Valence Nadia (lo más cercano estructuralmente) | | 5. Medición de mindset por lenguaje, invisible | **No como producto** | Stealth Assessment (Shute) + NLP clínico (LIWC/Pennebaker) — piezas separadas, nunca unidas comercialmente | | 6. Programa intensivo → membresía con sistema vivo | Sí, sin el artefacto | Reforge (programa→membresía $2K/año, pivote a AI 2025) | --- ## § 2 · Familia 1: Ciencia del aprendizaje clásica ### 2.1 Cognitive Apprenticeship (Collins, Brown & Newman, 1989) Hacer visible el pensamiento invisible del experto: modeling → coaching → scaffolding → articulation → reflection → exploration, situado en contexto real. **Evidencia:** la instanciación canónica (enseñanza recíproca) da d=0.32 en tests estandarizados y d=0.88 en tests del experimentador (Rosenshine & Meister 1994). **Es el pariente teórico más cercano de IBT.** Lo hace mejor: 35+ años de validación y énfasis explícito en *fading* (retirada del andamiaje) — el tutor 24/7 de IBT arriesga crear dependencia si nunca se retira. Le falta: disponibilidad continua, medición sistemática, artefacto persistente (la articulación es oral y efímera). ### 2.2 Deliberate Practice (Ericsson) y su crítica Práctica diseñada justo fuera de la zona de confort con feedback inmediato individualizado. **Evidencia matizada:** el meta-análisis de Macnamara et al. 2014 (88 estudios) muestra que explica solo 4% de varianza en educación y <1% en profesiones — pero Ericsson respondió que se midió práctica genérica, no deliberada con instructor individualizado. **Implicación directa:** el tutor IA 24/7 con feedback inmediato es exactamente el "maestro individualizado" que Ericsson exigía y que casi nunca existe en profesiones — argumento estructural a favor de IBT. Riesgo compartido: en dominios sin criterios objetivos de desempeño (liderazgo, paternidad), medir por lenguaje es proxy, no desempeño. ### 2.3 Mastery Learning y el 2-sigma de Bloom (1984) Nadie avanza sin dominar la unidad actual. El famoso "+2σ de la tutoría 1:1" está inflado: los meta-análisis modernos dan d≈0.4 en tests del curso, d≈0.1 en estandarizados (Kulik et al. 1990); la tutoría humana real ronda d≈0.7-0.8. **Lo hace mejor que IBT:** gates de mastery *duros* — IBT no especifica umbral de paso entre casos. **Le falta:** nunca abordó juicio experto ni problemas abiertos. ### 2.4 Expertise research / NDM (Gary Klein) Los expertos no comparan opciones: reconocen patrones (Recognition-Primed Decision). El Cognitive Task Analysis (CTA) extrae ese conocimiento tácito; ShadowBox entrena comparando decisiones del novato contra panel experto. **Evidencia fuerte:** entrenamiento basado en CTA logra g=0.871 (Tofel-Grehl & Feldon 2013) — comparable a tutoría real. **Implicación crítica:** el CTA es la metodología validada para el paso más frágil de IBT — *destilar* el BC ideal. IBT asume que el stack del practicante ideal ya está bien definido; Klein tiene 40 años de método para extraerlo con rigor. **Adoptar técnicas de CTA en la fase de destilación del BC ideal debería ser parte del MePB.** --- ## § 3 · Familia 2: Marcos pedagógicos de casos/problemas ### 3.1 Problem-Based Learning (McMaster) Casos clínicos antes que teoría, en grupos pequeños. **Evidencia:** efecto positivo robusto en skills y retención, tendencia negativa en conocimiento declarativo (Dochy et al. 2003, 43 estudios); en novatos de primer año, sin diferencia significativa (meta-análisis 2022). **Lección clave: el aprendizaje por casos falla con novatos sin andamiaje fuerte.** ### 3.2 La crítica Kirschner-Sweller-Clark (2006) La instrucción mínimamente guiada contradice la arquitectura cognitiva humana (memoria de trabajo limitada); medio siglo de evidencia favorece la guía explícita para novatos. Lazonder & Harmsen 2016 (72 estudios): la indagación funciona **solo con guía** (d=0.50-0.71). **Implicación de diseño para IBT:** el tutor IA debe cargar guía explícita fuerte en fases tempranas y retirarla gradualmente — no "dejar descubrir". La espiral no exime del andamiaje. ### 3.3 Case Method (HBS) y Minerva HBS: discusión socrática con evidencia empírica sorprendentemente escasa (soporte mayormente anecdótico). Minerva: seminarios 100% activos + ~80 "Habits of Mind" transferibles — el pariente comercial más cercano a "descomponer la expertise en unidades instalables"; #1 en CLA+ aunque con sesgo de selección obvio. **Lo que Minerva tiene y IBT no:** rúbricas validadas externamente. ### 3.4 Competency-Based Education (WGU) Avance por competencia demostrada, no por tiempo en silla. ~150,000 estudiantes, psicometría madura, pero las evaluaciones degeneran en checklists y la interacción humana se empobreció. **Lección:** escalar abaratando la interacción mata la transformación — IBT escala con IA sin eliminar las sesiones humanas en vivo (patrón sándwich). ### 3.5 Transformative Learning (Mezirow) + raíces constructivistas El aprendizaje adulto profundo = cambio de marcos de referencia (≈ instalar lentes). Mucho soporte empírico pero describe la transformación sin el "cómo" replicable; criticado por hiperracionalista y difícil de medir. **IBT es, en efecto, Mezirow instrumentado:** dilema desorientador = caso real; reflexión crítica = co-escritura del BC propio; el tutor IA es la ZPD de Vygotsky operacionalizada sin restricción de horario. --- ## § 4 · Familia 3: Mental models y decision education ### 4.1 Munger / Farnam Street "Latticework" de ~100 modelos interdisciplinarios; cursos de Shane Parrish (Decision by Design). Tracción de marca, **cero evaluación independiente de outcomes**. Crítica académica letal al enfoque "lista de modelos universales": los meta-análisis de Sala & Gobet muestran que el *far transfer* es nulo — entrenar "pensamiento general" no transfiere entre dominios. **Esto valida la apuesta de IBT por el stack dominio-específico** (el BC del padre consciente, del abogado, del operador) y debilita a quien venda modelos genéricos. ### 4.2 Decision Education / Good Judgment Project El dato duro más útil del benchmark: **el juicio SÍ se entrena** — 1 hora de entrenamiento probabilístico mejoró ~10% la precisión predictiva en RCT (Tetlock, GJP), efecto sostenido. Alliance for Decision Education con $12.5M para investigación. Límite: habilidad estrecha (calibración), sin stack de dominio ni artefacto personal. ### 4.3 Illness scripts (medicina) — el precedente más sólido del "BC ideal" La pericia clínica no está en mejor razonamiento general sino en la **organización del conocimiento en scripts** — la formalización académica más explícita del "sistema operativo cognitivo del practicante". Hay RCTs que muestran que enseñar por illness scripts mejora el razonamiento clínico, y ya existen chatbots que aceleran la formación de scripts. **IBT generaliza a cualquier dominio lo que la medicina ya validó en el suyo.** ### 4.4 Building a Second Brain / Life OS Lo más cercano al "artefacto propio como entregable": cohortes de 5 semanas (~$1,500, 25,000+ alumnos) donde el alumno sale con su sistema construido. **Pero el artefacto es organizacional (gestiona notas), no cognitivo (no instala lentes/principios/algoritmos).** Sin medición, sin casos, sin tutor. Valida la demanda de mercado por "salir con un sistema propio"; no compite en sustancia. --- ## § 5 · Familia 4: AI tutoring (2023-2026) ### 5.1 La evidencia causal ya existe - **Harvard (Kestin et al. 2025, RCT, 194 alumnos):** tutor IA con andamiaje experto pre-autorado (≈ RAG del practicante ideal) **duplicó** las ganancias vs clase activa, en menos tiempo. - **Nigeria / Banco Mundial (2025):** 6 semanas de tutoría con GPT-4 → +0.31 DE compuesto (+0.23 en inglés). *Matiz verificado:* es working paper (no peer-reviewed) y la equivalencia "1.5-2 años de escolaridad" es extrapolación promocional del blog del Banco — citar el DE, no los años. - **Tutor CoPilot (Stanford 2024, RCT 900 tutores / 1,800 alumnos):** IA asistiendo al tutor humano: +4pp dominio (+9pp con tutores débiles). **Valida el patrón híbrido humano+IA — el "sándwich" de IBT está donde la evidencia es más sólida.** - **Squirrel AI (China):** g=0.54-0.73 vs maestros expertos; entra a EE.UU. en 2026. - **Khanmigo:** ~1.4M usuarios pero sin RCT propio del componente IA. ### 5.2 El 2-sigma: ni cumplido ni refutado — reencuadrado Los mejores resultados con IA rondan 0.2-0.8 DE; el 2σ original era artefacto del estudio. La conclusión 2026: la IA democratiza tutoría de ~0.3-0.5 DE a costo marginal casi cero. Advertencia recurrente (Brake): la IA tiende a *explicar* en vez de *sondear* — genera aprendizaje pasivo si el diseño no la obliga a coachear. El SherpaIA debe diseñarse para preguntar, no para responder. ### 5.3 ¿Alguien tiene los dos Brain Codes? **No.** Harvard tiene el RAG del ideal sin memoria del alumno. Squirrel/Khanmigo tienen modelo del alumno sin corpus experto canónico. **Valence (Nadia)** es lo más cercano estructuralmente — memoria multi-sesión + contexto organizacional + disponibilidad continua, desplegado en Fortune 500 (Delta, Prudential 9x alcance de coaching, Series B $50M) — pero es coaching de managers sin sesiones en vivo ancla y sin artefacto del aprendiz. El RCT de Terblanche 2022 (PLOS One): chatbot coach logró goal attainment equivalente al coach humano. La arquitectura doble-BC + sándwich de IBT no tiene equivalente identificado. --- ## § 6 · Familia 5: Medición invisible y modelos de negocio cohort ### 6.1 Stealth Assessment (Shute) Evaluación embebida en la actividad (Evidence-Centered Design + redes bayesianas), validada empíricamente en juegos y migrando a educación médica y agentes conversacionales. **Es el marco metodológico que la "medición invisible" de IBT debería citar y adoptar** (ECD da el rigor que un score ad-hoc no tiene). Límite: diseño costoso por competencia. ### 6.2 Lenguaje como biomarcador (LIWC / NLP clínico) Evidencia sólida en clínica: modelos NLP predicen mejoría sintomática y alianza terapéutica desde transcripts; frontera 2024-2026 en LLMs estimando constructos psicológicos. **Límites para IBT:** la validación es clínica (depresión/ansiedad), no de mindset profesional; los marcadores funcionan a nivel cohorte antes que a nivel individuo. **No se encontró ningún producto educativo comercial que mida cambio de mindset desde lenguaje conversacional — el espacio está abierto.** ### 6.3 Cohort-based programs: la fórmula y la advertencia Completion: MOOCs 3-14% vs cohort 40-70% (altMBA reportaba 96%). Pero la brecha se explica por accountability y autoselección, y **completion ≠ transformación** — nadie en este mercado mide cambio de mindset con rigor. Estados 2026: **altMBA cerró** (2024 — workshop premium sin membresía no sobrevivió); **Reforge** pivoteó a AI con membresía $2K/año (programa→membresía→herramientas: el camino más parecido al de IBT); **Maven** activo (engagement 80-90%); **On Deck** sobrevivió achicándose. **Lección de negocio: el cierre de altMBA valida la tesis de Victor — el programa es el calificador, la continuidad del sistema vivo es el negocio.** --- ## § 7 · Síntesis: fortalezas, flancos débiles y mandatos de diseño ### 7.1 Donde IBT es más fuerte (sin equivalente identificado) 1. **El paquete completo** — los 6 elementos juntos no existen en ningún marco ni producto. 2. **El BC propio como entregable cognitivo** (BASB demostró la demanda; nadie entrega sustancia cognitiva). 3. **Doble Brain Code en el tutor** (ideal en RAG + aprendiz en memoria). 4. **Medición por lenguaje** — espacio comercialmente virgen con base científica plausible (Shute + NLP clínico). 5. **Respaldo indirecto fuerte:** illness scripts (RCTs), CTA g=0.87, GJP (+10% con 1 hora), Harvard 2x, Tutor CoPilot (híbrido > IA sola), far transfer nulo (valida dominio-específico). ### 7.2 Flancos débiles vs los clásicos (riesgos a resolver en el canónico) 1. **Sin gates de mastery ni fading.** Bloom exige umbral de dominio para avanzar; Collins exige retirar el andamiaje. El tutor 24/7 sin fading = dependencia, no instalación. → Definir umbrales de paso entre vueltas de la espiral y protocolo de retirada gradual del Sherpa. 2. **La destilación del BC ideal es el paso más frágil** y hoy es artesanal. → Incorporar técnicas de Cognitive Task Analysis (Critical Decision Method, ACTA) al MePB de destilación. 3. **La medición por lenguaje no está validada en este dominio.** → Posicionarla como "evidencia de evolución" (señales longitudinales estilo Shute/ECD), no como psicometría dura, hasta tener datos propios del piloto. Reportar a nivel cohorte antes que a nivel individuo. 4. **Tutor IA complaciente.** La evidencia (Brake; diseño de Kestin) exige que el Sherpa sondee y coachee, no explique. Los pares humanos de PBL/HBS confrontan; un bot tiende a validar. → Spec del SherpaIA con modo socrático por default + la cohorte como mecanismo de confrontación. 5. **Cero evidencia propia publicada.** Todos los competidores serios tienen números. → El piloto ArteSerPadres debe diseñarse desde el día 1 como estudio con pre/post e instrumentos definidos (no solo testimonios). ### 7.3 Mandatos para el documento canónico (MePB-EL-IBT-Metodologia) 0. **Delivery-agnostic (VH, 2026-06-07):** el proceso es interno en la mente del aprendiz; el coaching grupal, la mentoría 1:1 o el MPI/SherpaIA son vehículos de facilitación intercambiables. Criterio de éxito: cambio de comportamiento + resultados por adopción/desarrollo de un nuevo BC. El canónico se escribe sobre el proceso, no sobre un formato. 1. Citar el linaje honestamente: IBT = Cognitive Apprenticeship + Mezirow instrumentado + illness scripts generalizados + 2-sigma reencuadrado con IA — con nombre propio en la integración, no en las piezas. 2. Incluir capítulo de destilación con CTA (resuelve flanco 2). 3. Incluir gates de mastery y protocolo de fading en la espiral (resuelve flanco 1). 4. Definir el marco de medición sobre Evidence-Centered Design (resuelve flanco 3). 5. Spec del SherpaIA: socrático, guía fuerte al inicio con retirada programada (resuelve flancos 1 y 4). 6. Diseño del piloto como estudio de evidencia (resuelve flanco 5). --- ## § 8 · Fuentes principales | Tema | Fuente | |---|---| | Enseñanza recíproca d=0.32/0.88 | Rosenshine & Meister 1994 — journals.sagepub.com/doi/10.3102/00346543064004479 | | Deliberate practice 4%/<1% | Macnamara et al. 2014 — journals.sagepub.com/doi/abs/10.1177/0956797614535810 | | Mastery d≈0.4/0.1 | Kulik et al. 1990 — journals.sagepub.com/doi/10.3102/00346543060002265 | | 2-sigma cuestionado | nintil.com/bloom-sigma · substack.nomoremarking.com/p/blooms-famous-2-sigma-tutoring-paper | | CTA g=0.871 | Tofel-Grehl & Feldon 2013 — journals.sagepub.com/doi/abs/10.1177/1555343412474821 | | PBL meta-análisis | Dochy et al. 2003 — sciencedirect.com/science/article/abs/pii/S0959475202000257 | | Crítica guía mínima | Kirschner, Sweller & Clark 2006 — tandfonline.com/doi/abs/10.1207/s15326985ep4102_1 | | Indagación con guía d=0.5-0.7 | Lazonder & Harmsen 2016 — journals.sagepub.com/doi/abs/10.3102/0034654315627366 | | Far transfer nulo | Sala & Gobet 2017 — journals.sagepub.com/doi/full/10.1177/0963721417712760 | | GJP +10% con 1h | aiimpacts.org/evidence-on-good-forecasting-practices-from-the-good-judgment-project | | Illness scripts + RCT | ncbi.nlm.nih.gov/pmc/articles/PMC4795084 · PMC7856771 | | Harvard AI tutor 2x | Kestin et al. 2025 — nature.com/articles/s41598-025-97652-6 | | Nigeria +0.31 DE | blogs.worldbank.org/en/developmenttalk/addressing-the-learning-crisis-with-generative-ai | | Tutor CoPilot +4/9pp | arxiv.org/abs/2410.03017 | | Chatbot coach = humano | Terblanche et al. 2022 — journals.plos.org/plosone (PMID 0270255) | | Stealth Assessment | Shute — myweb.fsu.edu/vshute/pdf/sa_handbook.pdf · MIT Press open access | | LIWC / NLP clínico | receptiviti.com/liwc · PMC11299859 · PMC12427617 | | Cohort completion | openpraxis.org/articles/10.55982/openpraxis.16.3.606 · learnopoly.com/cohort-based-learning-statistics | | Reforge/altMBA/On Deck | reforge.com · akimbo.com/about · techcrunch.com (On Deck 2022) | | Valence Nadia | valence.co/research · bvp.com/news (Series B) | --- ## § 9 · NEXTs - [x] **JAY** Incorporar los mandatos a `MePB-EL-IBT-Metodologia-v01` → hecho 2026-06-07 (receta F1-F7, gates §5, anti-patrones §6) - [ ] **VH** Validar el canónico MePB (los mandatos quedaron integrados ahí) - [ ] **VH+JAY** Decidir posicionamiento del claim de medición por lenguaje (evidencia de evolución vs métrica dura) — afecta marketing del piloto - [ ] **JAY** Evaluar técnicas CTA/ACTA de Klein para el protocolo de destilación de BCs ideales ## § 10 · Changelog | Fecha | Versión | Cambio | |---|---|---| | 2026-06-06 | v01 | Creación. Benchmark de 5 familias (~25 metodologías/programas) vs los 6 elementos de la metodología (entonces "IBL-BC"). Hallazgo central: nadie combina el paquete; medición por lenguaje sin precedente comercial. 5 flancos débiles identificados y 6 mandatos de diseño para el canónico. | | 2026-06-07 | v01 | Referencias actualizadas al naming definitivo **IBT — Intelligence-Based Transformation** y al canónico `MePB-EL-IBT-Metodologia-v01`. | --- *WOI-EL-IBL-BenchmarkMetodologias-v01 · IB-EL-EmpowerLabs · 2026-06-06 · Jay*