基于 Anthropic Harness 框架的任务目标基准评测器。采用生成器-评估器分离架构(GAN 启发),支持前端设计评估(设计质量/原创性/工艺/功能性 4 维度)和全栈开发评估(冲刺合同/功能完整性/代码质量/用户体验 4 维度)。触发于 /harness-benchmark、「评估任务」、「benchmark harness」、「设计评估」、「质量评估」等关键词。
评估一个或一批 Agent Skills 的设计质量,按 8 个有来源、有证据的维度输出 0–100 分、S/A/B/C/D 等级和优先改进项。重点检查触发边界、完成闭环、决策适应、安全恢复、上下文效率、复杂度适配、一致性和真实行为;不奖励文件数量或流程堆砌。用于‘给 skill 打分’、‘扫描全部 skills’、‘benchmark skill 设计’、‘比较哪些 skills 值得优化’等场景;只评估,不修改被评 Skill。
Own this plugin?
Verify ownership to unlock analytics, metadata editing, and a verified badge. GitHub access is read-only (username + org membership).
Sign in to claimOwn this plugin?
Verify ownership to unlock analytics, metadata editing, and a verified badge. GitHub access is read-only (username + org membership).
Sign in to claimBased on adoption, maintenance, documentation, and repository signals. Not a security audit or endorsement.
npx claudepluginhub wangjs-jacky/jacky-skills --plugin evaluatorsClaude Code 配置管理 - 状态栏、环境变量等配置的自动设置
音视频处理工具集 - ASR 转录能力
Skills 管理工具 - 链接、安装、批量管理
媒体工具箱 - 视频流下载与格式修复工具
谈话型思考工具集 - 以 AI 为第三视角,通过结构化对话帮你把工作/生活/学习/情感抽丝剥茧地理清
Create, edit, evaluate, and package Claude Code agent skills — full draft→test→review→improve lifecycle.
Create and validate production-grade agent skills with 100-point marketplace grading
Evaluate prompts and skills through parallel execution comparison in git worktrees. Prompt optimization with BP-001~008 patterns, skill creation/update with quality grading, and blind A/B evaluation.
Agent and skill evaluation harness with MLflow integration
Skills 管理工具 - 链接、安装、批量管理
4 persona Agent Team skill builder — spawn real agents to analyze and debate, then build working skills with auto eval/benchmark, description optimization via run_loop, and .skill packaging