crewai-multi-agent
crewai自律的なAI協働のためのマルチエージェントオーケストレーションフレームワーク。複雑なタスクで協力する専門的なエージェントのチーム構築、メモリを使ったロールベースのエージェント協働が必要な場合、または順次・階層的な実行を必要とする本番ワークフローの際に利用します。

Skill 53 件 · 直近30日 48 回 · 未紐づけ
自律的なAI協働のためのマルチエージェントオーケストレーションフレームワーク。複雑なタスクで協力する専門的なエージェントのチーム構築、メモリを使ったロールベースのエージェント協働が必要な場合、または順次・階層的な実行を必要とする本番ワークフローの際に利用します。
連続エージェントの構築と展開のための自律型AIエージェントプラットフォーム。ビジュアルワークフローエージェントの作成、持続的な自律エージェントの展開、複雑な多段階AI自動化システムの構築などに利用されます。
LLM駆動の進化アルゴリズムを用いて、あらゆる領域でAIエージェントを自動的に進化・最適化するためのガイダンスを提供します。
自動ログでML実験を追跡し、リアルタイムでトレーニングを可視化し、スイープでハイパーパラメータを最適化し、W&Bでモデルレジストリを管理する(MLOpsプラットフォームの共同作業)を行えます
トレーニング指標の可視化、ヒストグラムによるモデルのデバッグ、実験の比較、モデルグラフの可視化、パフォーマンスのプロファイリング(GoogleのMLビジュアライゼーションツールキット)を使ったTensorBoardで行えます
SwanLabでの実験追跡に関する指針を提供します。オープンソースのラントラッキング、ローカルまたはセルフホストのダッシュボード、軽量なメディアログ(MLワークフロー)が必要なときに使ってください。
NVIDIA TensorRTを用いて最大スループットと最小遅延を実現するためにLLM推論を最適化します。
RadixAttentionプレフィックスキャッシュを備えたLLM向けの高速構造化生成とサービス。JSON/正規表現の出力、制約付きデコード、ツールコールによるエージェント型ワークフロー、またはプレフィックス共有でvLLMより5×速い推論が必要な場合などに使います。
NVIDIAハードウェアを使わず、CPU、Apple Silicon、コンシューマーGPU上でLLM推論を実行します。
18+ハーネス(MMLU、HumanEval、GSM8K、セーフティ、VLM)から100+ベンチマークにわたるLLMをマルチバックエンド実行で評価します。
HumanEval、MBPP、MultiPL-E、15+ベンチマークのコード生成モデルをpass@k指標で評価します。
LLM、視覚、拡散、医療画像、タンパク質/新薬発見、空間オミクス、ゲノミクスなど、あらゆる分野向けの実戦実証済みPyTorchトレーニングレシピ。
GGUFフォーマットとllama.cpp量子化による効率的なCPU/GPU推論。消費者向けハードウェアやApple Siliconでのモデル展開や、GPUが不要で2ビットから8ビットまでの柔軟な量子化が必要な場合に使用されます。
フラッシュアテンションでトランスフォーマーの注意力を最適化し、2〜4倍の高速化と10〜20倍のメモリ削減を実現します。
4ビットLLM圧縮のためのアクティベーション認識型ウェイト量子化で、3倍の高速化と最小限の精度損失を実現。
自動コスト最適化を備えたMLワークロードのマルチクラウドオーケストレーション。複数のクラウドでトレーニングやバッチジョブを実行したい場合、自動回復機能付きのスポットインスタンスを活用する際、プロバイダー間でGPUコストを最適化する必要がある場合に使えます。
MLワークロードを実行するためのサーバーレスGPUクラウドプラットフォーム。インフラ管理なしでオンデマンドGPUアクセスが必要な場合、MLモデルをAPIとして展開する場合、または自動スケーリング付きのバッチジョブを実行する場合に使います。
クラスター間の分散トレーニングオーケストレーション。PyTorch/TensorFlow/HuggingFaceをノートパソコンから数千のノードにスケールさせることができます。
Trainerクラス、自動分散トレーニング(DDP/FSDP/DeepSpeed)、コールバックシステム、最小限のボイラープレートを備えた高レベルPyTorchフレームワーク。
正しいinit、シャーディング、混合精度/オフロード設定、分散チェックポイントを備えたトレーニングスクリプトにPyTorch FSDP2(fully_shard)を追加します。
NVIDIA Megatron-Coreを用いて高度な並列処理戦略を用いて、大規模言語モデル(2B-462Bパラメータ)を訓練します。
DeepSpeedを用いた分散訓練に関する専門家ガイダンス - ZeRO最適化段階、パイプライン並列性、FP16/BF16/FP8、1ビットAdam、スパースアテンション
最もシンプルな分散トレーニングAPIです。4行でPyTorchスクリプトに分散サポートを追加できます。
Metaの7-8BのLLM入出力フィルタリング専用モデレーションモデル。6つの安全カテゴリー - 暴力/憎悪、性的内容、武器、物質、自傷行為、犯罪計画。
Anthropicは自己改善を通じて無害なAIを訓練する手法です。二段階のアプローチで、自己批評・修正を伴う教師あり学習、その後のRLAIF(AIフィードバックからの強化学習)を行います。
verl(Volcano Engine RL)を用いて強化学習を用いるLLMのトレーニングガイダンスを提供します。
強化学習を用いて強化学習を用いて、命令調整にはSFT、好みの整合のためのDPO、報酬最適化のためのPPO/GRPO、報酬モデルのトレーニングは利用可能です。
Megatron+SGLangフレームワークを用いて強化学習(RL)を用いたLLMポストトレーニングのガイダンスを提供します。
LLMアライメントのためのシンプルな優先最適化。DPOのリファレンスフリー代替で、より良いパフォーマンス(AlpacaEval 2.0で+6.4ポイント)です。
Ray+vLLMアクセラレーションを備えた高性能RLHFフレームワーク。大規模モデル(7B-70B+)のPPO、GRPO、RLOO、DPOトレーニングに使用されます。
TRLを用いたGRPO/RLのファインチューニングに関する専門家のガイダンスおよびタスク固有のモデルトレーニング
MLワークロード向けのスケーラブルなデータ処理。CPU/GPUをまたぐストリーミング実行はParquet/CSV/JSON/イメージをサポートしています。
LLMトレーニングのためのGPU加速データキュレーション。テキスト/画像/動画/音声に対応しています。
TransformerLensを用いてHookPointsおよびアクティベーションキャッシュを通じてトランスフォーマー内部を検査・操作するメカニズム的解釈可能性研究の指針を提供します。
SAELensを用いたスパースオートエンコーダー(SAE)の訓練および解析に関する指針を提供し、ニューラルネットワークの活性化を解釈可能な特徴に分解する。
nnsightを用いてニューラルネットワーク内部の解釈と操作のガイダンスを提供し、オプションでNDIFリモート実行も可能です。
Unslothの迅速なファインチューニングに関する専門家のガイダンス - 2〜5倍の速いトレーニング、50〜80%のメモリ削減、LoRA/QLoRA最適化
LoRA、QLoRA、25+メソッドを用いたLLMのパラメータ効率の高いファインチューニング。GPUメモリが限られている大型モデル(7B〜70B)の微調整や、パラメータの<1%を精度損失を最小限に抑えたい時、またはマルチアダプター対応の際に使います。
LLaMA-Factoryを用いたLLMのファインチューニングに関する専門家ガイダンス - WebUIノーコード、100+モデル、2/3/4/5/6/8ビットQLoRA、マルチモーダルサポート
Axolotlを用いたLLMのファインチューニングに関する専門的なガイダンス - YAML設定、100+モデル、LoRA/QLoRA、DPO/KTO/ORPO/GRPO、マルチモーダルサポート
言語に依存しないトークナイザーで、テキストを生のUnicodeとして扱います。BPEおよびUnigramアルゴリズムをサポートしています。
研究と生産に最適化された高速トークナイザー。Rustベースの実装は1GBを<20秒でトークン化します。
4D並列処理(FSDP2、TP、PP、CP)を用いたtorchtitanを用いたPyTorchネイティブの分散型LLM事前学習を提供します。
RNN+トランスハイブリッドでO(n)推論を行った。線形時間、無限のコンテキスト、KVキャッシュなし。
教育用GPTの実装は~300行で完成します。OpenWebText上でGPT-2(124M)を再現しています。
O(n) の複雑さを持つ状態空間モデルとトランスフォーマーの O(n²) モデル。5×より高速な推論、百万トークンのシーケンス、KVキャッシュなし。
Lightning AIのLitGPTを用いて、20+の事前学習済みアーキテクチャ(Llama、Gemma、Phi、Qwen、Mistral)を用いてLLMを実装・訓練します。
2ループアーキテクチャを用いてエンドツーエンドの自律型AI研究プロジェクトを統括します。インナーループは明確な最適化目標を持つ迅速な実験反復を実行します。
MLflow(フレームワークに依存しないMLライフサイクルプラットフォーム)で、MLflowによるML実験の追跡、バージョン管理、モデルの本番展開、実験の再現
60+の学術ベンチマーク(MMLU、HumanEval、GSM8K、TruthfulQA、HellaSwag)でLLMを評価します。
LLMを8ビットまたは4ビットに量子化し、50〜75%のメモリ削減を最小限の精度で抑えることができます。
Metaのライブラリであるtorchforge(インフラとアルゴリズムを分離するライブラリ)を用いるPyTorchネイティブのエージェントRLのガイダンスを提供します。
pyveneの宣言的介入フレームワークを用いたPyTorchモデルに対する因果介入の実施に関する指針を提供します。