--- type: RP asset_id: RP-EL-EScan-BCEffectStudy-v01 version: v01 status: Draft — pre-registro (pendiente de ratificación) owner: Victor Heredia sherpa_owner: Jay ratificador: Victor Heredia (L3+) fecha_creacion: 2026-07-01 intellbank: IB-EL-EmpowerLabs subbank: PB-EL-Project-Bank/PB-LoopX proposito: Protocolo de investigación (pre-registro) para medir el efecto de aumentar un analista LLM con un board de Brain Codes (cognición destilada) en el análisis de diagnósticos organizacionales EmpowerScan. Soporta un paper científico. confidencial: true · codename Posta tags: [RP, protocolo, pre-registro, braincodes, ablacion, ultrasherpax, escan, paper, metodologia] --- # Protocolo de Investigación — Efecto de los Brain Codes en un Analista LLM ## Estudio de ablación sobre diagnósticos organizacionales EmpowerScan (Caso 0: Posta) > **Naturaleza:** pre-registro. Todo lo que sigue se fija ANTES de correr los brazos. Cualquier cambio posterior se registra como desviación fechada (§17). Codename **Posta** en todo el documento. --- ## 1. Resumen (abstract operativo) Investigamos si **aumentar un agente analista basado en LLM con un board de "Brain Codes"** (sistemas operativos cognitivos destilados de fuentes expertas, montados vía la anatomía canónica de 9 capas) produce análisis **medicamente distintos y mejores** que líneas base, en la tarea de analizar un diagnóstico organizacional EmpowerScan (clasificación de aportaciones en patrones de disfunción, síntesis causal y recomendaciones). Diseño de **ablación** (5 brazos) con **separación de roles** (Analista / Evaluador independiente / Voz del Cliente), evaluación **ciega** contra un **patrón oro humano híbrido**, y análisis de confiabilidad (α de Krippendorff / κ) y validez (marco de Campbell). ## 2. Antecedentes y motivación EmpowerScan (linaje SEAM/Savall + capa IA) requiere convertir cientos de aportaciones cualitativas en un diagnóstico cuantificado y accionable. En la v1 esa clasificación se hizo con un **clasificador determinista por palabras clave** (frágil, sin razonamiento). La hipótesis de EmpowerLabs es que un **board de Brain Codes** (WORX) eleva la calidad del análisis. Falta **evidencia**: este estudio la produce, y de paso valida (o refuta) el mecanismo central de la tesis WORX/HiOrg. Contribución potencial al campo: un método reproducible para evaluar el aporte de "cognición modular destilada" a agentes LLM analíticos. ## 3. Pregunta de investigación e hipótesis **RQ:** ¿Qué efecto —en acuerdo con expertos humanos, fidelidad, cobertura y profundidad— tiene añadir (a) un método explícito y (b) uno o varios Brain Codes a un analista LLM, en el análisis de un diagnóstico EmpowerScan? Hipótesis falsables (pre-especificadas): - **H1 (método):** A2 (LLM+método) > A1 (LLM solo) en acuerdo con el patrón oro (α). - **H2 (BC dominante):** A3 (LLM+Savall) > A2 en fidelidad y profundidad. - **H3 (board):** A4 (board completo) > A3 en cobertura y profundidad, sin pérdida de fidelidad. - **H4 (línea base):** A1–A4 (cualquier LLM) > A0 (keywords) en cobertura y profundidad. - **H0 (nula):** no hay diferencias significativas entre brazos en las métricas primarias. - **H5 (estabilidad):** el board (A4) no incrementa la varianza entre corridas respecto a A2/A3 (robustez). ## 4. Diseño Estudio **experimental de ablación**, intra-caso (Posta), con **3 roles independientes** para evitar el conflicto "juez y parte": | Rol | Agente | Función | Independencia | |---|---|---|---| | **Analista** | `SVA-EL-EScanDiagnostico` y variantes por brazo | Produce el análisis (tratamiento) | Es el sujeto | | **Evaluador** | `SVA-EL-EScanEvaluador` (nuevo) | Califica a ciegas: α, fidelidad, alucinación, rúbrica | Cognición de método (Krippendorff/Campbell), **disjunta** de la del Analista | | **Voz del Cliente** | `SVA-EL-EScanVozDelCliente` (nuevo) | Anticipa objeciones/validez de stakeholder | Lentes del cliente (CEO, RRHH, CIO, CFO) | **Nota de honestidad (validez de constructo):** el Evaluador es un LLM y comparte "familia de modelo" con el Analista; por eso **no es el árbitro final**, sino un *instrumento de medición reproducible*. El árbitro es la **referencia humana + acuerdo inter-codificador**. El Evaluador se usa para escalar y estandarizar la medición, con su desempeño calibrado contra los codificadores humanos en el piloto. ## 5. Materiales y unidad de análisis - **Dataset:** `OUT-EL-EmpowerScan-Estafeta-TablaConsolidada-v02.xlsx` (558 aportaciones; hoja "Consolidado v02", columnas Estado/Pregunta/Room/Área/ID/Título/Descripción/Likes/Dislikes). Versionado y congelado como insumo. - **Unidad de análisis:** la aportación individual (con su ID). Tareas: (T1) clasificación de cada aportación de Q3 en la **taxonomía de 10 patrones** (mapeada a 5 dominios EScan); (T2) síntesis causal (grafo); (T3) recomendaciones. - **Esquema de codificación (codebook):** los 10 patrones y 5 dominios de la taxonomía EScan (documento aparte `DC-EL-EScan-Codebook-v01`, a formalizar en el piloto), con reglas de decisión y ejemplos ancla. ## 6. Condiciones / brazos (definición operacional) Todos reciben **el mismo input** (aportaciones Q3 + codebook) y **el mismo esquema de salida** (JSON: id → patrón, dominio, justificación citando verbatim). Temperatura fija (0.2), mismo modelo base, N corridas por brazo. - **A0 — Baseline determinista:** clasificador por palabras clave (el de la v1). Sin LLM. - **A1 — LLM solo:** prompt mínimo "clasifica en estas 10 categorías", sin método ni BCs. - **A2 — LLM + método:** A1 + el método EScan/SEAM (definiciones, reglas de decisión), sin BCs. - **A3 — LLM + BC dominante:** A2 + `BC-HenriSavall-CognitiveStack` (cognición socioeconómica). - **A4 — Board completo:** `SVA-EL-EScanDiagnostico` (Savall + Meadows + Senge + Edmondson + Schein + Kotter + Victor Own + Ismail + Secretan). ## 7. Patrón oro (ground truth) — híbrido - **Referencia primaria:** codificación experta de **Anahí** (autora del reporte v0.1). - **2º codificador independiente:** una segunda codificación bajo el mismo codebook, ciega a la de Anahí (persona del equipo o, en el piloto, el propio proceso humano supervisado). - **Confiabilidad inter-humana:** se reporta α de Krippendorff entre codificadores humanos; los desacuerdos se **adjudican** por consenso → patrón oro consolidado. - El acuerdo de cada brazo se mide **contra el patrón oro consolidado**; además se reporta la **convergencia entre brazos** (idea de Victor: comparar en paralelo). ## 8. Variables de resultado e instrumentos | # | Variable | Definición operacional | Instrumento | |---|---|---|---| | V1 | **Acuerdo/confiabilidad** | Coincidencia clasificatoria con el patrón oro | α de Krippendorff / κ de Cohen; matriz de confusión | | V2 | **Fidelidad** | % de afirmaciones ancladas a un verbatim real | Auditoría de trazabilidad (Evaluador + muestra humana) | | V3 | **Alucinación** | % de afirmaciones NO soportadas por los datos | Conteo ciego sobre muestra | | V4 | **Cobertura** | nº de temas/subtemas distintos recuperados vs. referencia | Recall temático | | V5 | **Profundidad/insight** | Presencia de causa-raíz, cruces, cuantificación | Rúbrica 0–3 por dimensión, raters ciegos | | V6 | **Estabilidad** | Varianza de V1–V5 entre N corridas | Desv. estándar / ICC | | V7 | **Costo** | Tokens y latencia por brazo | Log de ejecución | Métrica **primaria:** V1 (acuerdo, α). Métricas **secundarias:** V2, V4, V5. V3/V6/V7 de control. ## 9. El Evaluador independiente — cognición y justificación de sus Brain Codes El Evaluador **no** lleva la cognición del Analista (evita error correlacionado). Lleva cognición de **método y medición**: | Brain Code | Por qué se usa (justificación para el paper) | |---|---| | **`BC-KlausKrippendorff`** | Krippendorff es *el* referente de **análisis de contenido** y de la **confiabilidad entre codificadores** (α de Krippendorff). Nuestra tarea central es exactamente eso: codificar texto en categorías y medir acuerdo. Su cognición aporta las reglas para construir el codebook, medir α correctamente y distinguir acuerdo real de azar. | | **`BC-DonaldCampbell`** | Campbell (Campbell & Stanley 1963; Cook & Campbell 1979) es el referente de **validez y diseños (cuasi)experimentales** y del catálogo de **amenazas a la validez** (interna, externa, constructo, conclusión estadística). Su cognición audita el diseño y los sesgos, y sostiene la sección de amenazas del paper. Aporta además la "Ley de Campbell" (cuidado con optimizar la métrica). | | **`BC-KarlPopper`** *(opcional, fase 2)* | Falsabilidad: obliga a formular hipótesis refutables y a buscar el contraejemplo, no la confirmación. Postura epistémica del Evaluador. | **Límite documentado:** el Evaluador estandariza y escala la medición; su fiabilidad se **calibra contra los codificadores humanos** en el piloto (se reporta el α Evaluador↔humano). Si esa calibración es baja, el Evaluador se degrada a asistente y la medición recae en humanos. ## 10. La Voz del Cliente — validez de stakeholder `SVA-EL-EScanVozDelCliente` asume los lentes del cliente para **anticipar objeciones** al proceso y a los resultados, alimentando la sección de limitaciones y el manejo de objeciones. Personas: - **CEO / Dirección general** — ¿esto mueve el negocio? ¿ROI? ¿riesgo reputacional? - **Recursos Humanos** — clima, retención, manejo del hallazgo de liderazgo/trato, cuidado de las personas, aspectos laborales. - **CIO (Adriana)** — profundidad técnica, nivel del liderazgo, plan de acción. - **CFO escéptico** — "no está auditado", "es opinión de IA", sesgo muestral 109/140. ## 11. Procedimiento 1. **Piloto:** submuestra de Q3 (~40 aportaciones de alto voto). Correr A0, A2, A4 (núcleo). Calibrar Evaluador↔humano. Ajustar codebook y rúbricas. 2. **Estudio completo:** A0–A4 sobre las 558 (foco Q3 para clasificación; Q4 para el eje liderazgo). N=3 corridas/brazo (temp 0.2). Orden aleatorizado. 3. **Evaluación ciega:** los outputs se anonimizan (se elimina la marca de brazo) antes de calificar; raters humanos + Evaluador. 4. **Análisis y reporte.** ## 12. Plan de análisis estadístico (pre-especificado) - α de Krippendorff / κ por brazo, con **intervalos de confianza por bootstrap** (≥1000 remuestreos). - Comparaciones pareadas entre brazos (test apropiado según distribución); corrección por comparaciones múltiples (Holm). - Tamaños de efecto reportados (no solo p-valores). - Estabilidad: desv. estándar entre corridas; ICC. - Todo el análisis se corre en script versionado y reproducible. ## 13. Amenazas a la validez (marco Campbell) - **Constructo:** LLM-juez-de-sí-mismo → mitigado con Evaluador de cognición disjunta + árbitro humano + calibración. - **Interna:** fuga de datos (el patrón oro no debe filtrarse a los prompts); orden/aprendizaje → aleatorización, sin memoria entre corridas. - **Externa:** caso único (Posta) → **replicabilidad** con diagnósticos futuros (otras empresas/industrias) como test de generalización. - **Conclusión estadística:** N pequeño → reportar IC y tamaños de efecto; no sobre-interpretar. - **Ley de Campbell:** no optimizar los prompts para maximizar la métrica del Evaluador (se congelan antes de medir). ## 14. Criterios de éxito El estudio **soporta** la tesis de los Brain Codes si: A4 supera a A0/A1 en V1 y V4/V5 con efecto no trivial e IC que excluye 0, sin degradar V2/V3, y con estabilidad (V6) comparable. **Refuta** (parcial) si el board no aporta sobre A2/A3 → hallazgo igualmente valioso y honesto. ## 15. Reproducibilidad / ciencia abierta - Datos versionados (v01/v02, congelados). Prompts = los **archivos BC/SVA** citados por versión (son la especificación del tratamiento). - Log de cada corrida (entrada, salida, tokens, semilla/temperatura, fecha). - Scripts de análisis en el vault. Paquete de reproducibilidad al cierre. ## 16. Ética y confidencialidad Anonimato de las aportaciones; codename Posta; nunca el nombre real en documentos internos. El buzón (Q4) se maneja sin de-anonimizar. EmpowerScan® · derechos reservados **EmpowerLabs LTD**. ## 17. Cronograma (pasos) 1. ✅ Congelar v1. 2. ⏳ Protocolo (este doc). 3. Destilar BC-Krippendorff + BC-Campbell + forjar Evaluador. 4. Piloto + calibración. 5. Voz del Cliente (CEO+RRHH+CIO+CFO). 6. Estudio completo A0–A4. 7. Paper. ## 18. Bitácora / desviaciones | Fecha | Cambio respecto al pre-registro | |---|---| | 2026-07-01 | Creación del protocolo v01. |