evaluating-llms-harness
について
このスキルは、業界標準のlm-evaluation-harnessを使用して、MMLUやGSM8Kなど60以上の学術ベンチマークで標準化されたLLM評価を実行します。HuggingFace、vLLM、APIベースのモデルをサポートし、モデル品質のベンチマーク測定、異なるモデルの比較、トレーニング進捗の追跡にご利用いただけます。学術研究成果を報告するための一貫性があり広く採用されている手法を提供します。
クイックインストール
Claude Code
推奨npx skills add davila7/claude-code-templates -a claude-code/plugin add https://github.com/davila7/claude-code-templatesgit clone https://github.com/davila7/claude-code-templates.git ~/.claude/skills/evaluating-llms-harnessこのコマンドをClaude Codeにコピー&ペーストしてスキルをインストールします
GitHub リポジトリ
よくある質問
evaluating-llms-harness Skillとは何ですか?
evaluating-llms-harness はdavila7 が作成した Claude Skillです。Skillは、Claudeが必要に応じて読み込む指示とリソースをまとめ、追加の指示なしで evaluating-llms-harness に関連するタスクを実行できるようにします。
evaluating-llms-harness をインストールするには?
このページのインストールコマンドを使用してください。evaluating-llms-harness をプラグインとして Claude Code に追加するか、リポジトリを skills ディレクトリにクローンし、Claudeを再起動してSkillを読み込みます。
evaluating-llms-harness はどのカテゴリに属しますか?
evaluating-llms-harness は テスト カテゴリに属します。
evaluating-llms-harness は無料で利用できますか?
はい。evaluating-llms-harness は AIMCP に掲載されており、無料でインストールできます。
関連スキル
このClaudeスキルは、lm-evaluation-harnessを実行し、MMLUやGSM8Kなど60以上の標準化学術タスクでLLMをベンチマークします。開発者がモデルの品質を比較し、トレーニングの進捗を追跡し、学術的な結果を報告するために設計されています。このツールはHuggingFaceやvLLMモデルを含む様々なバックエンドをサポートしています。
このスキルは、cron式を使用してWorkersをスケジュールするためのCloudflare Cron Triggersの実装に関する包括的な知識を提供します。定期的なタスクの設定、メンテナンスジョブ、自動化されたワークフローの構築を網羅し、無効なcron式やタイムゾーン問題といった一般的な課題への対処法も含みます。開発者はこれを使用して、スケジュールされたハンドラーの設定、cronトリガーのテスト、WorkflowsやGreen Computeとの連携を構成できます。
このClaude Skillは、Playwrightベースのツールキットを提供し、Pythonスクリプトを通じてローカルWebアプリケーションのテストを可能にします。フロントエンドの検証、UIデバッグ、スクリーンショット撮影、ログ表示を実現し、サーバーライフサイクルを管理します。ブラウザ自動化タスクにご利用いただけますが、コンテキストの汚染を避けるため、スクリプトのソースコードを読むのではなく直接実行してください。
このスキルは、開発者がテストの合格を確認し、構造化された統合オプションを提示することで、完成した作業を仕上げることを支援します。実装が完了した後のマージ、PR作成、ブランチの整理といったワークフローを案内します。コードが準備できてテスト済みの際に使用し、開発プロセスを体系的に完了させましょう。
