tensorrt-llm
Über
TensorRT-LLM ist eine NVIDIA-Bibliothek zur Optimierung der LLM-Inferenz für maximalen Durchsatz und niedrigste Latenz auf NVIDIA-GPUs. Sie ist ideal für Produktionseinsätze, die eine 10- bis 100-fach schnellere Leistung als PyTorch erfordern, und unterstützt Funktionen wie Quantisierung und Multi-GPU-Skalierung. Verwenden Sie sie, wenn Sie maximale Leistung auf NVIDIA-Hardware benötigen; für einfachere Setups sind Alternativen wie vLLM oder für CPU/Apple Silicon llama.cpp die bessere Wahl.
Schnellinstallation
Claude Code
Empfohlennpx skills add zechenzhangAGI/AI-research-SKILLs -a claude-code/plugin add https://github.com/zechenzhangAGI/AI-research-SKILLsgit clone https://github.com/zechenzhangAGI/AI-research-SKILLs.git ~/.claude/skills/tensorrt-llmKopieren Sie diesen Befehl und fügen Sie ihn in Claude Code ein, um diese Fähigkeit zu installieren
GitHub Repository
Häufig gestellte Fragen
Was ist der Skill tensorrt-llm?
tensorrt-llm ist ein Claude Skill von zechenzhangAGI. Skills bündeln Anweisungen und Ressourcen, die Claude bei Bedarf lädt, um Aufgaben rund um tensorrt-llm ohne zusätzliche Eingaben auszuführen.
Wie installiere ich tensorrt-llm?
Verwende die Installationsbefehle auf dieser Seite: Füge tensorrt-llm als Plugin zu Claude Code hinzu oder klone das Repository in dein Skills-Verzeichnis. Starte Claude danach neu, damit der Skill geladen wird.
Zu welcher Kategorie gehört tensorrt-llm?
tensorrt-llm gehört zur Kategorie Andere.
Kann ich tensorrt-llm kostenlos nutzen?
Ja. tensorrt-llm ist auf AIMCP gelistet und kann kostenlos installiert werden.
Verwandte Skills
LlamaGuard ist Metas 7-8B-Parameter-Modell zur Moderation von LLM-Eingaben und -Ausgaben in sechs Sicherheitskategorien wie Gewalt und Hassrede. Es bietet eine Genauigkeit von 94-95 % und kann mit vLLM, Hugging Face oder Amazon SageMaker eingesetzt werden. Nutzen Sie diese Skill, um Inhaltsfilterung und Sicherheitsguardrails einfach in Ihre KI-Anwendungen zu integrieren.
Diese Claude Skill unterstützt Entwickler bei der Optimierung von Cloud-Kosten durch Ressourcen-Dimensionierung, Tagging-Strategien und Ausgabenanalysen. Sie bietet einen Rahmen zur Senkung von Cloud-Ausgaben und zur Implementierung von Kosten-Governance für AWS, Azure und GCP. Nutzen Sie sie, wenn Sie Infrastrukturkosten analysieren, Ressourcen richtig dimensionieren oder Budgetvorgaben einhalten müssen.
Diese Claude Skill analysiert Sportwettenmärkte inklusive Handicaps, Over/Unders und Spezialwetten, indem sie historische Trends und situative Statistiken untersucht, um Wertwetten zu identifizieren. Sie liefert strukturierte Markdown-Ausgaben mit umsetzbaren Empfehlungen zu Bildungszwecken. Entwickler sollten dies für Sportwetten-Analysetools nutzen, wobei zu beachten ist, dass es nur zur Unterhaltung/Bildung konzipiert wurde.
Diese Fähigkeit quantisiert LLMs auf 8-Bit- oder 4-Bit-Präzision mittels bitsandbytes und erreicht dabei eine Speicherreduzierung von 50–75 % bei minimalem Genauigkeitsverlust. Sie ist ideal für den Betrieb größerer Modelle mit begrenztem GPU-Speicher oder zur Beschleunigung von Inferenzvorgängen und unterstützt Formate wie INT8, NF4 und FP4. Die Fähigkeit integriert sich in HuggingFace Transformers und ermöglicht QLoRA-Training sowie 8-Bit-Optimierer.
