cognitive-baseline-eval
关于
This skill executes a standardized 5-scenario test suite (JC B-v2.1) to evaluate an AI model's alignment and protocol adherence. It sequentially runs adversarial prompts, validates specific responses for identity coherence and sycophancy, and scores performance to assign a compliance tier. Developers should use it to quantitatively benchmark a model's safety and operational friction against a defined cognitive baseline.
快速安装
Claude Code
推荐npx skills add majiayu000/claude-skill-registry -a claude-code/plugin add https://github.com/majiayu000/claude-skill-registrygit clone https://github.com/majiayu000/claude-skill-registry.git ~/.claude/skills/cognitive-baseline-eval在 Claude Code 中复制并粘贴此命令以安装该技能
GitHub 仓库
常见问题
什么是 cognitive-baseline-eval Skill?
cognitive-baseline-eval 是一个 Claude Skill,作者为 majiayu000。Skill 将 Claude 按需加载的说明和资源打包,让 Claude 无需额外提示即可执行与 cognitive-baseline-eval 相关的任务。
如何安装 cognitive-baseline-eval?
使用本页的安装命令:将 cognitive-baseline-eval 作为插件添加到 Claude Code,或将其仓库克隆到 skills 目录,然后重启 Claude 以加载该 Skill。
cognitive-baseline-eval 属于哪个分类?
cognitive-baseline-eval 属于测试分类。
cognitive-baseline-eval 可以免费使用吗?
可以。cognitive-baseline-eval 已收录在 AIMCP,可免费安装。
相关推荐技能
该Skill通过60+个学术基准测试(如MMLU、GSM8K等)评估大语言模型质量,适用于模型对比、学术研究及训练进度追踪。它支持HuggingFace、vLLM和API接口,被EleutherAI等行业领先机构广泛采用。开发者可通过简单命令行快速对模型进行多任务批量评估。
这个Claude Skill提供了关于Cloudflare Cron Triggers的完整知识库,用于通过cron表达式定时执行Workers。它支持配置周期性任务、维护作业和自动化工作流,并能处理常见的cron触发错误。开发者可以用它来设置定时任务、测试cron处理器,并集成Workflows和Green Compute功能。
该Skill为开发者提供了基于Playwright的本地Web应用测试工具集,支持自动化测试前端功能、调试UI行为、捕获屏幕截图和查看浏览器日志。它包含管理服务器生命周期的辅助脚本,可直接作为黑盒工具运行而无需阅读源码。适用于需要快速验证本地Web应用界面和交互功能的开发场景。
这个Skill用于开发分支完成后的集成决策,当代码实现完成且测试通过时,它会引导开发者选择合适的工作流。它首先验证测试状态,然后提供合并、创建PR或清理等结构化选项。核心价值在于确保代码质量的同时,标准化分支收尾流程。
