--- type: OUT asset_id: OUT-EL-EScan-PilotoBCEffect-v01 version: v01 status: Draft — resultados de piloto (respaldo metodológico interno) owner: Victor Heredia sherpa_owner: Jay ratificador: Victor Heredia fecha_creacion: 2026-07-01 intellbank: IB-EL-EmpowerLabs subbank: PB-EL-Project-Bank/PB-LoopX proposito: Resultados del piloto del estudio del efecto de los Brain Codes (protocolo RP-EL-EScan-BCEffectStudy-v01). Interno, no para cliente. confidencial: true · codename Posta tags: [OUT, piloto, braincodes, ablacion, kappa, krippendorff, evaluador, escan, respaldo-metodologico] --- # Piloto — Efecto de los Brain Codes en la clasificación de disfunciones ## Respaldo metodológico interno · no para cliente ## 1. Montaje - **Muestra:** 40 aportaciones de Q3 de **mayor voto** (v02; likes 17–10). Submuestra clara y de alto consenso. - **Codebook:** `DC-EL-EScan-Codebook-v01` (10 áreas ratificadas, mono-etiqueta, congelado antes de correr). - **Brazos (independientes, contexto aislado):** - **A0** — clasificador determinista por palabras clave (baseline, sin LLM). - **A2** — LLM + método/codebook (sin Brain Codes). - **A4** — LLM + cognición de board (Savall + sistémico + psicología org). - **Referencia (Gold):** un codificador experto independiente (agente separado), ciego a los brazos. *Provisional* — en el estudio completo lo reemplaza la codificación humana de Anahí. - **Evaluador:** `SVA-EL-EScanEvaluador` (Krippendorff + Campbell + Popper). ## 2. Resultados (acuerdo con la referencia) | Brazo | Acuerdo | κ (Cohen) | Errores /40 | |---|---|---|---| | **A0** keywords | 87.5% | 0.83 | 5 | | **A2** método | 97.5% | 0.97 | 1 | | **A4** board | **100%** | **1.00** | **0** | - α de Krippendorff (A2, A4, Gold): **0.977**. Con A0 incluido: **0.909**. - Único caso donde A2 falló y A4 acertó: ítem **360** ("se incorporan cambios con el desarrollo en curso… causa retrabajo"). A2 lo leyó como planeación (C9); A4, con **foco causal** (Savall/sistémico), lo leyó como proceso/retrabajo (C2), igual que la referencia. ## 3. Interpretación del Evaluador (con salvedades — postura de refutación) **Lo que el piloto SÍ muestra:** - Salto grande de **A0 (keywords) → A2/A4 (LLM+método)**: κ 0.83 → 0.97–1.00. La línea base determinista se queda corta; el método con razonamiento eleva el acuerdo de forma clara. Este contraste es el más limpio porque A0 es genuinamente independiente. - El board (A4) resolvió el **único caso causalmente ambiguo** que el método solo (A2) erró. **Lo que el piloto NO prueba (honestidad epistémica):** 1. **Efecto techo / submuestra fácil.** Las aportaciones de alto voto son claras; la tarea satura y las diferencias A2↔A4 se comprimen (1 ítem). *No se puede concluir* superioridad del board en clasificación a partir de esto. 2. **La referencia es un LLM, no humana.** Que A2/A4 coincidan 97–100% con Gold está parcialmente inflado por "misma familia de modelo". El árbitro debe ser **Anahí (humano)** en el estudio completo (Campbell: validez de constructo; el propio protocolo lo exige). 3. **La clasificación es una rebanada estrecha** del valor del analista. El aporte esperado de los Brain Codes está en la **síntesis causal, la profundidad y la cuantificación** (V5) — no medidas aquí. 4. **N pequeño, un caso.** Direccional, no concluyente (validez de conclusión estadística). **Conclusión del piloto:** el **mecanismo funciona** (los 3 roles corrieron limpio, con datos reales) y la **hipótesis se refina**: el board no se distingue del método en clasificación *fácil*; su ventaja debe demostrarse en (a) ítems **ambiguos** y (b) **profundidad de síntesis**. El piloto ya insinúa la ventaja causal (ítem 360). ## 4. Recomendaciones para el estudio completo 1. **Patrón oro humano:** codificación de Anahí (+ 2º codificador) → medir α inter-humano y calibrar el Evaluador↔humano. 2. **Submuestra más difícil:** incluir aportaciones de **bajo voto / ambiguas** y de Q4 (buzón), donde el board debería separarse. 3. **Medir profundidad (V5):** rúbrica ciega de causa-raíz, cruces y cuantificación sobre la síntesis, no solo la clasificación. 4. **Escalera completa (A0–A4):** añadir A1 (LLM solo) y A3 (solo Savall) para aislar método vs. BC dominante vs. board. 5. **Corridas repetidas (N≥3)** para estabilidad; IC por bootstrap. ## 5. Mini-experimento de PROFUNDIDAD (V5) — casos ambiguos Para atacar el efecto techo del §3, corrimos **A2 (método) vs A4 (board)** produciendo un **análisis profundo** (no solo etiqueta) de **4 casos ricos/ambiguos** (360 cambios de alcance; 261 urgencia→erosión del reconocimiento; 224 estrategia difusa; 654 buzón "se premia al que se queja"). Un **evaluador ciego independiente** (agente separado, sin saber cuál análisis era cuál, **orden aleatorizado por caso**) los calificó con rúbrica 0–3 en 4 dimensiones: causa-raíz, pensamiento sistémico, costo oculto (COT), accionabilidad/apalancamiento. **Resultado (evaluador ciego):** | Caso | A4 board /12 | A2 método /12 | Más profundo (ciego) | |---|---|---|---| | 360 | 12 | 8 | **Board** | | 261 | 12 | 8 | **Board** | | 224 | 11 | 8 | **Board** | | 654 | 12 | 8 | **Board** | | **Media** | **11.75** | **8.0** | **Board 4/4** | Por dimensión, el board superó al método en las cuatro (causa-raíz, sistémico, costo oculto, apalancamiento). Cualitativamente, el board aportó lo que el método no: **arquetipos sistémicos nombrados** ("shifting the burden", "todo urgente", "éxito para el que grita"), **mapeo explícito a los 6 componentes COT** de Savall, **puntos de apalancamiento** (Meadows) y la **capa de seguridad psicológica/cultura** (Edmondson/Schein). **Interpretación:** esto **invierte el resultado de clasificación**. Donde la tarea es fácil (clasificar), método ≈ board (efecto techo). Donde la tarea exige **síntesis causal** (el valor real del diagnóstico), el board es **claramente superior** y el evaluador ciego lo detectó en 4/4. Confirma la hipótesis refinada: *el aporte de los Brain Codes está en la profundidad, no en la clasificación*. **Salvedades (se mantienen):** el evaluador es un LLM (falta rater humano); N=4 casos; posible confound de verbosidad (mitigado: la rúbrica midió profundidad, no longitud, y se instruyó no premiar verbosidad). Direccional y prometedor, no concluyente. ## 6. Bitácora | Fecha | Nota | |---|---| | 2026-07-01 | Piloto de clasificación A0/A2/A4 (40 ítems alto-voto). Método >> keywords; board ≈ método (efecto techo). | | 2026-07-01 | Mini-experimento de profundidad V5 (4 casos ambiguos, evaluador ciego). Board > método en 4/4 casos (media 11.75 vs 8.0). El efecto de los BC aparece en la síntesis, no en la clasificación. Refina H3. |