--- type: MI asset_id: MI-XX-BMF-EcosistemaSkills-Benchmark-v01 version: v01 status: Draft · benchmark citado · insumo del PLAN-EcosistemaSkills-v02 owner: Victor Heredia sherpa: Jay ratificador: Victor Heredia intellibank: IB-XX-Maestro subbank: IPI-XX-IP-Infraestructura / IPI-XX-BMF-Engine proposito: > Benchmark 2026 (deep-research, multi-fuente y verificado) de cómo las plataformas líderes diseñan y gobiernan ecosistemas de skills/plugins para agentes. Insumo directo del PLAN-XX-BMF-EcosistemaSkills-v02 y del diseño de sk-skillvalidator. Mapeado a las 5 áreas del outline de Victor. relacionado: - PLAN-XX-BMF-EcosistemaSkills-v02 (el plan que este benchmark alimenta) - CP-EL-SkillsRegistry-v01 · sk-ibhealth · sk-wikivalidator · skill-creator gate_g0: PASS fecha_creacion: 2026-07-11 tags: [MI, benchmark, deep-research, skills, plugins, marketplace, gobernanza, validacion, citado] --- # Benchmark 2026 · Ecosistemas de Skills para Agentes ## Deep-research verificado — qué adoptamos, mapeado a nuestro plan > **Método.** 5 frentes en paralelo (naming/taxonomía · registro · validación/auditoría · creación democratizada · diseño compacto/distribución), fuentes primarias (Anthropic, MCP, Microsoft, Salesforce, OWASP, Gartner, npm, VS Code) con verificación adversarial. Lo que sigue es solo lo que **cambia o confirma** nuestro plan. --- ## Hallazgo transversal (el más importante) **Todo registro maduro separa dos capas: (1) un manifiesto fuente-de-verdad que el autor controla (junto al código: `SKILL.md`, `plugin.json`, `server.json`, `package.json`) y (2) una proyección de catálogo que el registro agrega y el autor NO puede auto-declarar (estado activo/deprecado, verificación, hash de integridad, descargas).** La identidad es siempre un ID con namespace; el versionado es SemVer en todos lados; el auto-update solo dispara cuando el string de versión cambia. → **Valida nuestra regla "una fuente, tres consumidores"** y define cómo debe verse `CP-EL-SkillsRegistry`. --- ## Área 1 · Naming / sintaxis / taxonomía - **La `description` es el contrato de disparo, no el nombre.** Claude, Copilot, GPT Actions y MCP enrutan por la descripción en lenguaje natural; el nombre es para namespacing y humanos. Descripción en 3ª persona, con "Usar cuando…", ≤1024 chars. → **Nuestra convención `sk-`/`wx-` es el namespace; la calidad de disparo vive en la description** (el validador debe checarla). - **La madurez NO va en el prefijo — va en un campo de versión/metadata.** Ningún sistema codifica alpha/beta/GA en el nombre. → **Nuestros 3 carriles (L0/L1/L2-3) van como campo `estado` en el Registro, no en el `sk-`.** - **El prefijo es slug de propiedad, inmutable una vez publicado** (npm `@scope`, Claude `plugin:skill`, renombrar rompe instalaciones). Regla Obsidian: nunca meter el nombre de la plataforma en el leaf. → Confirmar `sk-{dominio}-{especialidad}` y no renombrar tras publicar (usar `displayName` para relabel). - **Salesforce AgentExchange usa 4 niveles de composición** (Action → Topic → Template → Agent). → Nuestro `skill → /sh- → /ux-/dx-` es el mismo patrón; mantenerlo explícito. ## Área 2 · Registro (qué contiene, dónde vive) - Campos del manifiesto (unión de MCP `server.json` + Claude `plugin.json` + registro enterprise): `id namespaced · version SemVer · owner · description · triggers · dependencies · permissions · packages/hash`. - **Añadir un campo de permisos por clase de riesgo** (registro enterprise Kosmoy): `read / draft / recommend / low-risk-execute / high-risk-execute`. → Nuevo campo en `CP-EL-SkillsRegistry`, y el catálogo gatea instalación por riesgo, no solo por versión. - **Integridad content-addressed** (`fileSha256` + host allowlisted en MCP) — la entrada es verificable, no un puntero mutable. → Adoptar hash por plugin publicado. - **El versionado es el único disparador honesto de update** (Claude Code) con fallback a SHA de git para fuentes sin versión. ## Área 3 · Validación / eval-gate / auditoría - **Validación estructural con esquema cerrado:** `plugin.json` de Claude Code **rechaza propiedades desconocidas** (additionalProperties:false); `name` ≤64, kebab, = nombre de carpeta; `description` ≤1024. → `sk-skillvalidator` rechaza claves desconocidas, no las ignora. - **`skill-creator` ya trae 4 modos** (Create/Eval/Improve/Benchmark) con **3 corridas por caso** + **split 60/40 held-out** para no sobreajustar el disparo. → El validador **envuelve** el eval de skill-creator, no lo reinventa. - **Seguridad = clase de amenaza real:** OWASP publicó el **MCP Top 10 (2025)**; **MCP03 Tool Poisoning** (instrucciones ocultas en metadata) y ataques supply-chain reales (Postmark sep-2025, Smithery oct-2025, 3,000+ apps). "Verified" solo verifica identidad, no código (VS Code: 27→105 extensiones maliciosas 2024→2025). → El validador debe **escanear** secretos filtrados, firmas de tool-poisoning ("ignora instrucciones", URLs de exfiltración, unicode smuggling) y **permisos sobre-amplios vs. propósito** (least-privilege). - **"Un gate que solo puede dar PASS es teatro"** — confirmado como principio de CI (eval-gating). → Inyectar periódicamente **fixtures malos conocidos** (skills envenenadas) para probar que el gate sigue atrapando. - **La auditoría es continua, no puntual:** re-auditoría trimestral (el drift va más rápido que la compra) + **re-validación por cambio material** (nueva tool/dato/MCP dispara re-clasificación). → **`sk-ibhealth` y `sk-wikivalidator` ya hacen piezas** (duplicados, rutas muertas, DRIFT) — el validador **extiende**, no reemplaza. ## Área 4 · Creación democratizada con gobernanza - **Gartner: 150,000 agentes por empresa Fortune-500 para 2028** (desde <15 en 2025); el "todos crean" sin gobierno es insostenible → inventario central + controles por riesgo. → **Valida de lleno tu decisión de 3 carriles.** - **El modelo canónico es el semáforo:** verde (construcción libre) / amarillo (colabora con pro-dev) / rojo (aprobación). → **= tus 3 carriles L0/L1/L2-3, exactamente.** - **Paved-road / Backstage:** cada componente se auto-registra con un `catalog-info.yaml` **con campo `owner` obligatorio al crear** — esto **mata el fallo de "agentes huérfanos"** desde el origen. → **Toda skill L0 nace ya registrada con dueño**, aunque no se publique. - **HITL como piso regulatorio** (EU AI Act Art. 14, ago-2026): draft → aprueba humano → publica, con bitácora. → Cada promoción entre carriles es una **ratificación humana registrada**. - **Gobernanza federada por dominios** (Center of Excellence) en vez de cuello central. → **Owners de dominio** curan su carril canónico (dg=Anahí, infra=Alex, método=Jay). ## Área 5 · Diseño compacto + distribución - **Progressive disclosure de 3 niveles:** metadata (preload) → cuerpo SKILL.md (al activarse) → archivos bundled (bajo demanda). **Cuerpo <500 líneas**; refs **exactamente un nivel de profundidad** (más profundo → Claude lee parcial y falla). - **Grados de libertad:** prosa para tareas variables; **script exacto e inmodificable** para lo determinista/frágil (ordenar, migrar). → El validador prefiere script sobre "código generado" en operaciones mecánicas. - **Evals-first:** ≥3 evals **antes** de escribir doc extensa; descripción "empujada" con las palabras que el usuario realmente teclea (Claude tiende a sub-disparar). - **Distribución:** marketplace org **debe ser privado/interno** (repos públicos no permitidos); CI `claude plugin validate` en GitHub Action; SemVer explícito; tiers internal→partner→public. AppExchange como ancla de rev-share (15% add-on / 25% embebido). → **Alimenta directo el EXP-2026-23 (4 tiers).** --- ## Qué cambia en el plan (acciones) 1. `CP-EL-SkillsRegistry`: adoptar **2 capas** (manifiesto + proyección) + campos **permisos-por-riesgo** y **hash**. 2. `sk-skillvalidator`: 3 bloques — **estructura (esquema cerrado)** · **seguridad (tool-poisoning/secretos/least-privilege)** · **calidad+eval (envuelve skill-creator, con fixtures rojos)**. 3. Auditoría: el validador **extiende** `sk-ibhealth`/`sk-wikivalidator` (no duplica); cadencia trimestral + trigger por cambio material. 4. 3 carriles = semáforo + **owner obligatorio al crear** (Backstage) + **promoción con HITL registrado** (EU AI Act). 5. Diseño de skills: lint de **<500 líneas / refs 1 nivel / evals ≥3 / description-first**. ## Fuentes - Anthropic — Agent Skills best practices: https://platform.claude.com/docs/en/agents-and-tools/agent-skills/best-practices - Anthropic — Equipping agents (progressive disclosure): https://www.anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills - Anthropic — skill-creator (test/measure/refine): https://claude.com/blog/improving-skill-creator-test-measure-and-refine-agent-skills - Claude Code — plugins reference / marketplaces: https://code.claude.com/docs/en/plugins-reference · https://code.claude.com/docs/en/plugin-marketplaces - Claude — org plugin management: https://support.claude.com/en/articles/13837433-manage-plugins-for-your-organization - MCP — server.json spec: https://raw.githubusercontent.com/modelcontextprotocol/registry/refs/heads/main/docs/reference/server-json/generic-server-json.md - MCP tool naming: https://modelcontextprotocol.io/specification/2025-06-18/server/tools - OWASP — MCP Top 10 (Tool Poisoning MCP03): https://owasp.org/www-project-mcp-top-10/2025/MCP03-2025%E2%80%93Tool-Poisoning - VS Code extension marketplace risk (Wiz): https://www.wiz.io/blog/supply-chain-risk-in-vscode-extension-marketplaces - Salesforce AgentExchange explained: https://appexchange.salesforce.com/learn/agentexchange-explained - Salesforce security review: https://developer.salesforce.com/docs/atlas.en-us.packagingGuide.meta/packagingGuide/security_review_how_it_works.htm - Microsoft — Copilot Studio governance / Agent 365: https://www.microsoft.com/en-us/microsoft-copilot/blog/copilot-studio/new-and-improved-agent-governance-intelligent-workflows-and-connected-app-experiences/ - Microsoft 365 — declarative agent plugins: https://learn.microsoft.com/en-us/microsoft-365/copilot/extensibility/overview-plugins - Gartner — agent sprawl (150k by 2028): https://www.gartner.com/en/newsroom/press-releases/2026-04-28-gartner-identifies-six-steps-to-manage-artificial-intelligence-agent-sprawl - Citizen-dev governance (traffic-light): https://www.superblocks.com/blog/citizen-developer-governance - Backstage golden paths / catalog-info: https://www.redhat.com/en/topics/platform-engineering/golden-paths - Agent registry (control plane): https://prefactor.tech/learn/what-is-an-agent-registry · https://www.arthur.ai/column/ai-agent-inventory-enterprises - npm registry metadata: https://github.com/npm/registry/blob/main/docs/responses/package-metadata.md - VS Code extension manifest: https://code.visualstudio.com/api/references/extension-manifest - Agent Skills open standard: https://agentskills.io/specification ## CHANGELOG | Versión | Fecha | Cambio | |---|---|---| | v01 | 2026-07-11 | Benchmark deep-research (5 frentes, verificado). Hallazgos + 5 acciones que actualizan el PLAN-EcosistemaSkills-v02 y el diseño de sk-skillvalidator. |