--- type: AUD asset_id: AUD-EL-EScanMetodo-RoomB-v01 version: v01 status: Draft — pendiente ratificación owner: Victor Heredia sherpa_owner: Jay (Fable 5) ratificador: Victor Heredia fecha_creacion: 2026-07-01 intellbank: IB-EL-EmpowerLabs subbank: PB-EL-Project-Bank/PB-LoopX proposito: Auditoría independiente Room B del método completo EScan/Brain Codes (anatomía, BCs, UltraSherpas, protocolo/piloto de ablación, paper, BCE). Encuadre Popper — buscar activamente lo refutable. Salida — veredicto de solidez + mejoras priorizadas. alcance_bcs: Solo los 11 BCs del método EScan + Own-v02 + BCE (banco completo fuera de alcance) benchmark: Consistencia interna + literatura externa (content analysis, LLM-as-judge, ablation, pre-registro, persona prompting) metodo_auditoria: 3 auditores adversariales independientes (BCs-vs-anatomía · SVAs · benchmark metodológico con web) + verificación de hallazgos críticos contra archivos fuente por Jay confidencial: true · codename Posta · EmpowerScan® © EmpowerLabs LTD tags: [AUD, roomB, escan, braincodes, ultrasherpas, ablacion, paper, popper, auditoria] --- # AUD — Auditoría independiente del método EScan/Brain Codes (Room B) > Mandato: auditoría no-juez-y-parte de todo el método, buscando activamente dónde flaquea, qué falta y qué sobra. Tres auditores adversariales corrieron en paralelo sin acceso a las conclusiones de los otros; sus hallazgos convergieron de forma independiente en los mismos puntos críticos, lo que aumenta la confianza en el diagnóstico. Todos los hallazgos de severidad ALTA fueron verificados contra los archivos fuente antes de escribir este documento. --- ## 0. Resumen ejecutivo (lenguaje simple) ### Encuadre: para qué es esta auditoría Esta auditoría **no es un examen académico** ni una discusión sobre si los Brain Codes elegidos son los "correctos". Sirve a dos objetivos concretos: 1. **Que el reporte para Posta sea poderoso y defendible** frente al cliente. 2. **Que la metodología sea replicable y blindada**: lo suficientemente sólida para ayudar a los clientes a identificar las disfunciones que generan costos ocultos, caso tras caso, sin que nadie pueda tumbarla con una objeción simple. Todo lo que sigue se lee bajo esa lupa: ¿esto bloquea el propósito, o es detalle de laboratorio? ### Lo que encontramos, en corto - **La estructura del método es buena** — mejor que lo típico en este terreno. El protocolo, el codebook y la gobernanza son el activo real. Eso no está en duda. - **El problema no es el método: es lo que hoy decimos que ya probamos.** La "prueba" de que los Brain Codes mejoran el análisis se basa en solo 4 casos, calificados por una IA que premia justo las palabras que le pedimos usar al brazo ganador. Con eso no se puede decir "está demostrado". Se puede decir "hay una señal prometedora" — que es distinto y es suficiente por ahora. - **El "evaluador independiente" todavía no es independiente.** Es la misma IA, del mismo equipo, evaluando trabajo del mismo ecosistema. La independencia hay que construirla, no declararla. - **Hay descuidos operativos que sí urgen:** un nombre real del cliente (Adriana) quedó dentro de un activo reutilizable; los 4 asistentes no están registrados donde las reglas lo exigen; hay calificaciones fuera de escala usándose para autorizar modos de operación. ### Qué significa para cada objetivo **Para Posta:** el diagnóstico **se puede entregar** — el contenido analítico es sólido y el handoff ya lo encuadra bien (cifras direccionales, no auditoría). Lo único que hay que cuidar: no decir "validado científicamente" ni "el cliente ya lo validó" (la simulación de CEO/CFO no es validación), y sacar los nombres y datos del caso de los activos reutilizables. **Para la metodología replicable:** blindarla requiere 4 cosas concretas, todas alcanzables: 1. **Un check humano externo** — segundo codificador real que no sea del equipo. 2. **Un control justo** — comparar contra un brazo que tenga los mismos marcos conceptuales pero sin Brain Code. Eso responde la única pregunta que importa: ¿qué aporta el BC en sí? 3. **Evaluador de otra familia de IA** — para que nadie pueda decir "la IA se calificó a sí misma". 4. **Más casos con criterio de selección fijo** — no elegidos a mano. Con esas 4 piezas, el método queda defendible ante cualquier cliente, comprador o auditor externo. Sin ellas, queda expuesto a que un escéptico lo desarme en una reunión. ### Veredicto simple **El método vale y el camino para blindarlo es claro y concreto.** Lo que hay que corregir de inmediato no es el método — es la distancia entre lo que tenemos probado y lo que ya afirmamos. Blindar = cerrar esa distancia. ### Las 5 acciones que más protegen (esta semana) 1. Bajar el tono del paper: de "demostrado" a "señal prometedora, en confirmación". 2. Sacar a Adriana y los datos del caso Posta del SVA-VozDelCliente. 3. Dejar de citar el "4/4" como prueba dentro del DNA hasta replicarlo con humanos. 4. Registrar los 4 SVAs y corregir las calificaciones fuera de escala. 5. Planear el estudio confirmatorio con las 4 piezas de arriba. **Nota sobre los hallazgos de BCs (secciones 3 y 4):** los detalles sobre capas, redundancias y evidencias de los Brain Codes NO bloquean el propósito — por eso viven en P1/P2 (backlog). Se documentan porque blindan a futuro, no porque frenen a Posta hoy. --- ## 1. Veredicto global **Sólido con reservas serias.** La arquitectura documental (protocolo, codebook, anatomía, gobernanza) está claramente por encima de la media del género: hipótesis falsables con criterios de refutación explícitos, catálogo de amenazas a la validez estilo Campbell, codebook congelado antes de medir, y salvedades honestas en los propios resultados. Ese es el activo real. Pero la evidencia empírica actual **no soporta los claims que el sistema ya hace de sí mismo**. El resultado estrella (board 4/4, media 11.75 vs 8.0) es un análisis exploratorio post-hoc con N=4 que ni siquiera alcanza significancia bajo el test más simple (binomial exacto: p = 0.0625), medido con una rúbrica que premia el vocabulario que el propio tratamiento inyecta, por un solo juez LLM del mismo modelo base, sin control de verbosidad reportado. Y ese dato ya circula como evidencia fundacional dentro del BCE ("el DNA"). La formulación más honesta del estado actual: **el método es prometedor y — esto es lo valioso — es evaluable. Pero todavía no ha pasado por su propio estándar popperiano.** El sistema instala a Popper como evaluador y a la vez cita como prueba un estudio interno confirmatorio de muestra mínima. Cerrar esa brecha es la prioridad número uno. ### Veredictos por componente | Componente | Veredicto | Nota | |---|---|---| | Anatomía canónica (MePB v02) | Sólida con reservas | Arquitectura funcional justificada; redundancia por diseño, falta capa de "críticas a la fuente", citas propias con errores | | BCs board DO (Savall…Laloux) | Sólidos con reservas serias | Fieles a doctrina pública, arbitraje bien diseñado; evidencia ausente por componente, C3 simulado, ~4 voces efectivas de 7 | | BCs Metodología (Krippendorff, Campbell, Popper) | Los más sólidos del lote | Criterios operativos reales (α, amenazas, falsadores); Popper delgado, sin ejemplo trabajado | | Own-v02 + BCE (DNA) | Débiles como par | Mejor higiene individual del banco ([V]/[D]/[P], CAL) pero circuito de autoconfirmación cerrado | | SVA-EScanDiagnostico | Sólido con reservas | El mejor del banco; board de 9 sin evidencia de efecto ni de no-dilución | | SVA-EScanEvaluador | Sólido como instrumento; débil como "independiente" | La independencia se declara, no se construye | | SVA-EScanVozDelCliente | Débil | No cumple la fórmula SVA; contaminación de caso; ancla comercial | | SVA-HiOrgWorX | Sólido con reservas | Mayor blast-radius y opera sin instrumento de medición | | Protocolo RP + Codebook | Publicables como diseño | Mejor que la media; el problema es que piloto y paper corren delante del diseño | | Piloto OUT + Paper PP | No resisten peer review hoy | Válidos como factibilidad interna; sobre-afirman como evidencia | --- ## 2. Hallazgos críticos (P0) — bloquean cualquier claim externo **P0.1 · Circularidad rúbrica–tratamiento.** Las 4 dimensiones de la rúbrica de profundidad (causa-raíz, pensamiento sistémico, costo oculto, apalancamiento) son isomorfas a los BCs instalados en el brazo A4 (Savall=COT, Meadows=apalancamiento, Senge=arquetipos). A4 gana porque la vara mide su propio vocabulario: un brazo instruido a hablar de COT puntúa más alto en "menciona COT" por construcción. Es contaminación tratamiento-criterio — exactamente la Ley de Campbell que el protocolo §13 dice vigilar. *Afecta: OUT §5, PP §5.* **P0.2 · El resultado estrella no alcanza significancia.** N=4 pareado con H0 de 50% da p = 0.0625; los 4 casos fueron seleccionados a mano por ser "ricos/ambiguos" (y uno elegido precisamente porque A4 ya había acertado ahí — selección favorable); una sola corrida, sin semillas, sin IC — todo lo que el propio RP §12 exige (bootstrap ≥1000, N=3 corridas, Holm) está ausente. Los puntajes de A2 clavados en 8/12 en los 4 casos sugieren anclaje del juez, no medición. *Afecta: OUT §5, PP abstract y §5, BCE.* **P0.3 · Falta el brazo control que aísla el constructo.** A4 = A2 + persona + frameworks. Cualquier efecto puede deberse a la inyección de frameworks como texto plano, sin anatomía de 9 capas ni "persona". La literatura de expert personas es directamente adversa a la premisa central y el paper no la cita: Zheng et al. (EMNLP 2024, 162 personas, sin mejora sistemática — arxiv.org/abs/2311.10054), Wharton Prompting Science Report 4 (2025, "Expert Personas Don't Improve Factual Accuracy" — arxiv.org/abs/2512.05858), PRISM 2026 (personas mejoran estilo, dañan accuracy). Nótese: el propio resultado de clasificación del piloto (A4 ≈ A2) es *consistente con esa literatura contraria*. La hipótesis no está muerta — hay resultados positivos en tareas generativas abiertas — pero hay que ganarle al control correcto: un brazo **A2+** (método + mismos frameworks como referencia plana, sin BC). Si A4 ≈ A2+, el efecto es del contenido, no del Brain Code. *Afecta: tesis central del PP.* **P0.4 · El "evaluador independiente" no lo es.** Cuatro capas del problema: (a) mismo modelo base que los brazos que evalúa — el self-preference bias de LLM-as-judge persiste aunque cambies la persona del prompt (arxiv.org/abs/2410.21819); la "cognición disjunta" es disjunta a nivel prompt, no a nivel de pesos; (b) cegado nominal — un output que nombra "shifting the burden" y COT es trivialmente identificable como el brazo board; (c) gobernanza circular — Owner y Ratificador de analista, evaluador, rúbricas y protocolo es la misma persona, y el veredicto escala al dueño de la tesis evaluada; (d) el patrón oro descansa en la codificadora que es autora del reporte v0.1, y el protocolo admite como "2º codificador" al propio proceso supervisado. El κ 0.97–1.00 contra un Gold que también es LLM está inflado por la misma razón. La independencia se demuestra, no se declara en el frontmatter. *Afecta: SVA-EScanEvaluador, RP §6–7, PP §4.* **P0.5 · Circuito de autoconfirmación en el DNA.** La cadena es cerrada: la anatomía acredita mejoras a Victor → BC-Own usa esa sesión como Anchor Case → el BCE cita al BC-Own como material → el BCE usa el "4/4" (n=4, interno, sin auditoría externa) como evidencia central del principio "evidencia > opinión". Un DNA que declara "refutar antes de creer" (0.8) pero cuya evidencia fundacional es confirmatoria y mínima no pasa su propio estándar. Agrava: BC-Own no documenta ni un solo sesgo, error histórico o modo de falla del dueño (estructuralmente hagiográfico, destilado por el SherpaX subordinado), e incluye tipologías infalsables (Human Design/Gene Keys) como capa estructural en un ecosistema que instala a Popper como evaluador. *Afecta: BC-VictorHeredia-Own-v02, BCE.* --- ## 3. Hallazgos estructurales (P1) **P1.1 · Evidencia ausente por componente en 12 de 13 BCs.** El Distiller exige (REGLA 1) que cada componente se ancle a cita, decisión documentada o comportamiento observable, o se marque INSUFICIENTE. En 9 BCs la mayoría de lentes/principios/reglas no tienen campo de evidencia ni locator. Savall es la excepción parcial. Hoy ningún BC corto pasaría el QA §4 del propio motor. **P1.2 · El QA de FASE 2 nunca se ejecutó (o no se documentó).** Ningún BC contiene la matriz de los 6 tests que justifica su Readiness Score. Además: **⭐⭐⭐½ no existe en la escala** (enteros ⭐–⭐⭐⭐⭐⭐), y según la tabla canónica ⭐⭐⭐ = "Beta — no Board Mode"; sin embargo Popper y BCE declaran `usage_modes: [.., BOARD]` con ⭐⭐⭐½. Contradicción operativa directa. (Verificado en frontmatter de ambos archivos.) **P1.3 · Los "patrones tácitos" (C3) no son tácitos.** La anatomía define C3 como lo que la fuente *no puede articular*; los C3 de los BCs de fuentes públicas son reformulaciones de doctrina explícita — relleno que simula la capa más difícil. La anatomía prevé "TÁCITO PENDIENTE — requiere observación directa"; nadie lo usó. Correlato: 10 BCs "destilados" en 48 horas (2026-06-30/07-01) es generación asistida, no destilación de corpus. **P1.4 · El "pre-registro" no cumple estándares de pre-registro.** Protocolo, codebook, piloto **y paper** tienen la misma fecha (2026-07-01, verificado) — no hay precedencia temporal demostrable; el ratificador es el owner; y el mini-experimento de profundidad **no estaba en el procedimiento del piloto** (RP §11 planeaba solo clasificación; V5 especificaba raters humanos en plural) — es análisis exploratorio post-hoc presentado con lenguaje confirmatorio ("Confirma la hipótesis refinada"). Eso es HARKing suave. Un pre-registro real exige repositorio externo timestamped read-only (OSF/AsPredicted), power analysis y plan de análisis con criterios de decisión. **P1.5 · Verbosidad no controlada.** El OUT afirma que el confound se mitigó porque "se instruyó no premiar verbosidad" (verificado, §82). La literatura muestra que el verbosity bias persiste pese a instrucciones; las mitigaciones aceptadas son análisis controlado por longitud y reporte de longitudes. No se reporta la longitud de A2 vs A4. Si A4 escribe 2–3× más (típico de prompts con más frameworks), longitud y "profundidad" están confundidas. **P1.6 · El paper afirma más de lo que el piloto soporta.** El abstract dice "el hallazgo es limpio y honesto" y "un evaluador ciego eligió al agente con Brain Codes en 4 de 4"; el §4 describe evaluación "a ciegas contra un patrón oro humano" cuando la evidencia del §5 no usó patrón oro humano ni rater humano alguno (verificado, líneas 27 y 70). El §8 de límites es bueno — pero un abstract así no sobrevive al revisor 2. Reescribir en clave de *estudio de factibilidad con señal direccional*. **P1.7 · VozDelCliente no es un UltraSherpaX y se contradice.** Sin ningún BC (frontmatter sustituye `brain_code` por `personas`), sin capa cognitiva, sin CAL propio: es roleplay con etiqueta SVA. Los 4 roles son estereotipos sin base citada. Contradicción dura: declara "no inventa personas reales; simula arquetipos" pero hardcodea **"CIO (Adriana)"** — persona real del cliente — más datos del caso dentro de un activo de banco reutilizable (verificado, líneas 29 y 69). Contaminación de caso + riesgo de confidencialidad. Y el `proposito_ancla` obliga a verificar que el entregable "muestra cómo HiOrg WorX apoya": el simulador del cliente está anclado al objetivo de venta de la casa — riesgo estructural de falsa validación ("ya lo validó el cliente"). El RP §10 llama a esto "validez de stakeholder": sobre-claim; una simulación no confiere validez. **P1.8 · Muestra de fiabilidad insuficiente y no representativa.** Lacy & Riffe (1996): ≥50 unidades o 10% del corpus (558 → ~56), muestreadas aleatoriamente. Aquí: 40 ítems elegidos por alto voto (los más claros), lo que infla el acuerdo. El κ=1.00 no debería citarse como logro en el paper. Falta el α inter-humano ANTES de calibrar cualquier juez LLM (coincide con el pendiente §3 del handoff). --- ## 4. Hallazgos de mantenimiento (P2) **P2.1 · Redundancia en el board DO.** Meadows↔Senge comparten lente central, arquetipo "shifting the burden", anti-patrón y casi el mismo B3; Edmondson↔Schein se solapan en miedo/silencio/cultura. Con 5 de 7 voces en tono "riguroso, sobrio, humilde", el board de 7 es ~4 voces efectivas. Mitigante real: las cláusulas "DOMINANTE en X / cede a Y" son un buen mecanismo. Opciones: fusionar Meadows+Senge o forzar casos de desacuerdo explícito entre ellos. **P2.2 · La anatomía no pasa su propio estándar de evidencia.** Redundancia por diseño (en BC-Popper, "no rescates ad hoc" aparece en 5 capas distintas); falta la capa "Críticas y límites conocidos de la fuente" (el "70% de fracasos" de Kotter es empíricamente cuestionado — Hughes 2011; la evidencia de Laloux es anecdótica; nada aparece) — sin esa capa todo BC es hagiográfico por diseño; "70-80% del conocimiento experto es tácito" se afirma sin fuente (Polanyi nunca cuantificó); "Constitutional AI (Anthropic, 2025)" — el paper es de 2022; `confidence: muy_alta` no existe en el schema. **P2.3 · Gobernanza incumplida con sus propias reglas.** Ninguno de los 4 SVAs está registrado en `CP-EL-SkillsRegistry-v01` como exige el README (verificado por grep: cero registros). El template no tiene sección "Límites y modos de falla" — hueco sistémico (solo el Evaluador tiene cláusula de degradación). HiOrgWorX — el SVA de mayor riesgo para el cliente — opera sin instrumento de medición. Reproducibilidad prometida (RP §15) no entregada: sin log de corridas, semillas ni versiones de modelo en el OUT. Referencias sin versionar y campos fuera de template (`banco_consulta_oncall`). --- ## 5. Lo que sí está bien (justicia del auditor) El protocolo RP es notablemente mejor que la media del género: hipótesis falsables con criterios de refutación (§14), escalera de ablación A0–A4 correcta, catálogo de amenazas Campbell, salvedad honesta sobre el evaluador LLM. El codebook tiene reglas de desambiguación reales y se congeló antes de medir. El OUT distingue "lo que muestra / lo que no prueba" y nombra sus confounds. BC-Own-v02 tiene la mejor higiene epistémica del banco (marcadores [V]/[D]/[P], CAL-1–5, status "Pendiente validación"). Los BCs de metodología traen criterios operativos accionables (umbrales α, congelar codebook, falsador-primero), no principios abstractos. La trazabilidad SVA→BC es real: los 15 BCs referenciados existen con la versión exacta citada. El conjunto de 4 SVAs cubre el ciclo sin redundancia. Y la amenaza "LLM-juez-de-sí-mismo" está nombrada en el propio protocolo — el equipo sabe dónde le duele; lo que falta es actuar en consecuencia antes de usar los resultados. **Convergencia independiente:** los tres auditores, sin verse, llegaron a los mismos tres puntos — (1) la independencia del Evaluador se declara pero no se construye, (2) el 4/4 no soporta el peso que ya carga, (3) el circuito Own→BCE es juez y parte. Cuando tres líneas de ataque distintas dan en el mismo blanco, el blanco es real. --- ## 6. Mejoras priorizadas (roadmap) **Ahora (antes de cualquier uso externo del método):** 1. Reescribir abstract y §5 del paper en clave de estudio de factibilidad con señal direccional; alinear §4 con lo que de verdad se hizo. Quitar "validez de stakeholder" del RP §10. 2. Extraer a Adriana y los datos del caso Posta del SVA-VozDelCliente; disclaimer obligatorio en sus outputs ("objeciones hipotéticas; no sustituye revisión real"). 3. Retirar el "4/4" como evidencia dentro del BCE hasta que exista replicación con humanos; corregir readiness scores fuera de escala y bloquear BOARD bajo ⭐⭐⭐⭐. 4. Registrar los 4 SVAs en CP-EL-SkillsRegistry. **Siguiente sprint (estudio confirmatorio — la joya):** 5. Registro externo del protocolo (OSF) **antes** de correr; ratificador ≠ owner para activos de evidencia; etiquetar el piloto actual como exploratorio. 6. Añadir brazo **A2+** (frameworks como texto plano, sin BC, sin persona) — es el control que decide si el Brain Code existe como constructo. Añadir brazo A3.5 (board reducido) para medir dilución de los 9 BCs. 7. N ≥ 30 casos ambiguos muestreados por criterio pre-especificado, ≥3 corridas por brazo, IC bootstrap, test binomial/Wilcoxon pre-registrado; reportar longitudes y controlar verbosidad. 8. Juez de familia de modelo distinta + panel ≥2 jueces + orden invertido; test de identificabilidad del brazo; rúbrica framework-neutral redactada por alguien ciego a la composición de los brazos y validada con ≥2 raters humanos (α ≥ 0.667). 9. Patrón oro humano con 2º codificador genuinamente externo, ciego al método; muestra de fiabilidad aleatoria estratificada ≥56 ítems; κ inter-humano antes de calibrar al Evaluador. (Coincide con pendientes §3 del handoff — este roadmap los vuelve bloqueantes, no opcionales.) **Backlog (banco y anatomía):** 10. QA de 6 tests ejecutado y adjunto a cada BC; evidencia con locator o INSUFICIENTE; C3 → "TÁCITO PENDIENTE" en BCs de fuente pública; TEST 7 nuevo: "¿qué produce este BC que el LLM sin BC no produce?" con A/B documentado. 11. Anatomía v03: capa "Críticas y límites conocidos de la fuente"; reducir redundancia estructural; corregir citas propias (Constitutional AI 2022; retirar "70-80% tácito" o citarlo). 12. Sección "Failure Modes / Sesgos conocidos" obligatoria en BC-Own y BCE; excluir Own y BCE de boards que evalúen activos del propio ecosistema; fusionar o diferenciar Meadows/Senge; TP-UltraSherpaX v02 con "Qué NO hago / cómo fallo"; renombrar el Evaluador a "evaluador estandarizado calibrado"; extender evaluación a HiOrgWorX o declarar que opera sin instrumento. --- ## 6-bis. Plan de curación iterativa — cómo se perfecciona el proceso con cada diagnóstico La lógica: **cada diagnóstico nuevo es una iteración del método**, no solo un entregable. Cada ciclo cierra piezas del blindaje y deja el proceso más sólido que el anterior. **Ciclo 0 — Posta (ahora, sin frenar el reporte):** - Higiene inmediata: las 5 acciones del resumen ejecutivo (tono del paper, sacar datos de caso de los SVAs, retirar el 4/4 del DNA, registrar SVAs, corregir readiness). - Entregar el reporte Posta con encuadre direccional (ver guía de edición para Room A). - Capturar en LabPraxis lo aprendido de esta auditoría (caso CAS- del proceso). **Ciclo 1 — Estudio confirmatorio (sobre los mismos datos Posta, sin necesitar cliente nuevo):** - Registrar el protocolo en OSF antes de correr; ratificador ≠ owner. - Brazo control A2+ (mismos marcos sin BC) + brazo A3.5 (board reducido). - N ≥ 30 casos con criterio de selección fijo, 3 corridas, intervalos de confianza. - Juez de otra familia de IA + patrón oro humano (Anahí + 2º codificador externo, κ inter-humano primero). - Rúbrica neutral al framework, validada con 2 raters humanos. - **Gate de salida:** aquí se decide con datos si el BC aporta sobre los marcos solos. Lo que salga, se publica internamente tal cual. **Ciclo 2 — Diagnóstico #2 (otra empresa/industria):** - Replicación completa del protocolo ya curado → validez externa. - Codebook v02 si el nuevo caso revela áreas que el de 10 no cubre. - Primera medición de HiOrgWorX (hoy opera sin instrumento). - **Gate de salida:** el método funciona fuera de Posta o se documenta dónde se rompe. **Ciclo 3+ — Estandarización (el método como producto):** - Anatomía v03 y QA de BCs ejecutado (backlog sección 6). - Template SVA v02 con modos de falla. - Protocolo empaquetado: cualquier diagnóstico nuevo corre el mismo pipeline y sus resultados alimentan el banco automáticamente. - Métricas de proceso acumuladas entre casos (α histórico, tasas de acierto, tiempo por fase). **Regla permanente de mejora:** todo diagnóstico termina con (a) un caso LabPraxis de lo que falló o sorprendió, y (b) una revisión de si el protocolo necesita versión nueva. El método nunca se congela — se versiona. --- ## 7. Referencias externas usadas Self-preference bias: arxiv.org/abs/2410.21819 · Sesgos LLM-as-judge: llm-judge-bias.github.io · Verbosidad: wandb.ai/site/articles/exploring-llm-as-a-judge · Expert personas (adversa): arxiv.org/abs/2311.10054 (Zheng, EMNLP 2024), arxiv.org/abs/2512.05858 (Wharton 2025), PRISM 2026 · Fiabilidad en content analysis: Lacy & Riffe 1996 (journals.sagepub.com/doi/10.1177/107769909607300414), k-alpha.org/methodological-notes, matthewlombard.com/reliability · Pre-registro: help.osf.io/article/330, cos.io/initiatives/prereg · Kotter cuestionado: Hughes 2011. --- *Auditoría Room B · 3 auditores adversariales independientes + verificación contra fuente · Jay (Fable 5) · 2026-07-01 · EmpowerScan® © EmpowerLabs LTD*