MCP HubMCP Hub
SKILL·9BAD0A

optimizing-attention-flash

davila7
Обновлено 4 months ago
265 просмотров
18,478
1,685
18,478
Посмотреть на GitHub
ДругоеOptimizationFlash AttentionAttention OptimizationMemory EfficiencySpeed OptimizationLong ContextPyTorchSDPAH100FP8Transformers

О программе

Этот навык реализует Flash Attention для оптимизации трансформерных моделей, обеспечивая ускорение в 2-4 раза и сокращение использования памяти в 10-20 раз для длинных последовательностей (>512 токенов). Он идеально подходит при возникновении проблем с памятью GPU или необходимости ускоренного инференса трансформеров. Навык поддерживает несколько бэкендов, включая нативную SDPA от PyTorch, библиотеку flash-attn и ускорение на H100 с FP8.

Быстрая установка

Claude Code

Рекомендуется
Основной
npx skills add davila7/claude-code-templates -a claude-code
Команда плагинаАльтернативный
/plugin add https://github.com/davila7/claude-code-templates
Git клонированиеАльтернативный
git clone https://github.com/davila7/claude-code-templates.git ~/.claude/skills/optimizing-attention-flash

Скопируйте и вставьте эту команду в Claude Code для установки этого навыка

GitHub репозиторий

davila7/claude-code-templates
Путь: cli-tool/components/skills/ai-research/optimization-flash-attention
0
anthropicanthropic-claudeclaudeclaude-code
FAQ

Часто задаваемые вопросы

Что такое Skill optimizing-attention-flash?

optimizing-attention-flash — это Claude Skill от davila7. Skills объединяют инструкции и ресурсы, которые Claude загружает по мере необходимости, чтобы выполнять задачи, связанные с optimizing-attention-flash, без дополнительных запросов.

Как установить optimizing-attention-flash?

Используйте команды установки на этой странице: добавьте optimizing-attention-flash в Claude Code как плагин или клонируйте репозиторий в каталог skills, затем перезапустите Claude, чтобы загрузить Skill.

К какой категории относится optimizing-attention-flash?

optimizing-attention-flash относится к категории Другое.

Можно ли использовать optimizing-attention-flash бесплатно?

Да. optimizing-attention-flash размещён на AIMCP и доступен для бесплатной установки.

Похожие навыки

llamaguard
Другое

LlamaGuard — это модель от Meta с 7–8 миллиардами параметров для модерации входных и выходных данных больших языковых моделей по шести категориям безопасности, таким как насилие и разжигание ненависти. Она обеспечивает точность 94–95% и может быть развернута с помощью vLLM, Hugging Face или Amazon SageMaker. Используйте этот навык, чтобы легко интегрировать фильтрацию контента и защитные механизмы в ваши ИИ-приложения.

Просмотреть навык
cost-optimization
Другое

Этот навык Claude помогает разработчикам оптимизировать облачные расходы за счет правильного подбора ресурсов, стратегий тегирования и анализа затрат. Он предоставляет framework для сокращения облачных расходов и внедрения управления затратами в AWS, Azure и GCP. Используйте его, когда вам нужно проанализировать расходы на инфраструктуру, оптимизировать ресурсы или уложиться в бюджетные ограничения.

Просмотреть навык
sports-betting-analyzer
Другое

Этот навык Клода анализирует рынки спортивных ставок, включая форы, тоталы и ставки на игроков, изучая исторические тенденции и ситуационную статистику для выявления валуйных ставок. Он предоставляет структурированный вывод в формате markdown с практическими рекомендациями в образовательных целях. Разработчикам следует использовать его для инструментов анализа спортивных ставок, учитывая, что он предназначен исключительно для развлечения и обучения.

Просмотреть навык
quantizing-models-bitsandbytes
Другое

Этот навык выполняет квантизацию LLM до 8-битной или 4-битной точности с использованием библиотеки bitsandbytes, обеспечивая сокращение использования памяти на 50-75% при минимальной потере точности. Он идеально подходит для запуска больших моделей при ограниченной памяти GPU или для ускорения вывода, поддерживая форматы INT8, NF4 и FP4. Навык интегрируется с HuggingFace Transformers и позволяет использовать обучение QLoRA и 8-битные оптимизаторы.

Просмотреть навык