NVIDIA CorporationHivelocity is deploying NVIDIA L4 Tensor Core GPUs across its bare metal bundles, a concrete product adoption of NVIDIA's GPUs.

Hivelocityは、同社のTier 3ベアメタルバンドルの複数でGPUアクセラレーションが利用可能になったと発表した。これにより顧客は、小規模言語モデルやローカルAIツールを本番環境で実行するための専用の場を得られる。アクセラレーションを提供するのはNVIDIA L4 Tensor Core GPUで、シングルスロット、消費電力72ワット、GPUメモリ24GBのカードだ。Hivelocityによると、このカードはほとんどの量子化された小規模言語モデルを余裕をもって収容でき、より消費電力の大きいカードでは許されない多くの構成や拠点でGPUコンピューティングを可能にする。同社は、この動きが、共有型でトークン課金制のAIサービスから、自ら運用する小規模な調整済みモデルへと顧客が移行していることへの対応だと説明した。30億から130億パラメータの範囲の小規模言語モデルは現在、要約、分類、抽出、検索拡張検索、エージェントやチャットのバックエンドといった本番作業の大きな割合を担っている。サーバーはシングルテナントであるため、顧客はGPU時間を奪い合うことなく一貫した推論レイテンシーを得られ、プロンプト、埋め込み、ファインチューニングデータ、モデルの重みは、エンドツーエンドで自らが管理するハードウェア上にとどまる。Hivelocityは、これがデータ居住性、HIPAA、または推論の実行場所に関する契約上の制限の下にあるチームにとって重要だと述べた。最高製品責任者のNed Pope氏は、顧客が予測可能なコストで、自ら管理するハードウェア上に小規模で焦点を絞ったモデルを本番投入していると語った。またHivelocityは、拠点ごとの初期数量は限られており、先着順で割り当てられると注記した。
NVIDIA CorporationHivelocity is deploying NVIDIA L4 Tensor Core GPUs across its bare metal bundles, a concrete product adoption of NVIDIA's GPUs.
Hivelocity adds NVIDIA L4 GPU acceleration to its bare metal bundles in response to customer demand for running small language models in production.