
大規模言語モデル(LLM)
大規模言語モデル(LLM: Large Language Model)は人工知能の一種であり、大量のテキストデータを学習して言語に関する知識を獲得する機械学習モデルです。自然言語処理の分野でとても重要な役割を果たしています。
イベント
マガジン
技術ブログ
はじめに 以前の記事 では、SUSE AIとSUSE AI Factoryの概要と、両者の位置づけを紹介しました。今回は、SUSE AI Factoryの中身について紹介します。 vLLMで高速推論、Milvusでベクトル検索、Open WebUIでチャット、MLflowで実験管理。生成AI基盤に欠かせないこうしたOSSを、SUSE AI Factoryならひとつのプラットフォームで扱えます。 本記事では、まずSUSE AI Factoryの仕組みとユースケース、アーキテクチャを紹介します。そのうえで、SUSE AI Factoryで使えるAIアプリケーションを役割ごとに取り上げ、それぞれの特徴を詳しく解説します。 SUSE AI Factoryとは SUSE AI Factoryの基本的な特徴については 以前の記事 を参照してください。 SUSE AIとSUSE AI Factoryとは? ここではそれから一歩踏み込んだSUSE AI Factoryの仕組みとユースケース、アーキテクチャを紹介します。 SUSE AI Factoryのユースケース紹介 SUSE AI Factoryには、SUSEが用意したBlueprintと呼ばれる「AIアプリケーションを構成する複数のAIコンポーネントの構成情報をまとめ、一括でデプロイできるようにしたテンプレート」が同梱されています。例えば以下の3つのBlueprintがあります。 Blueprint 用途 Simple chatbot with RAG 社内文書などを検索し、その内容をもとに回答するRAG(検索拡張生成)のチャットボット Simple chatbot with RAG (vLLM and Milvus) 推論にvLLM、ベクトルDBにMilvusを使うRAGチャットボット Simple inference endpoint アプリから呼び出すための、LLMの推論エンドポイント 利用者がAI Library(SUSE AI Factoryで使えるAI関連アプリケーションを、SUSEが厳選・検証してまとめたもの)から自分でアプリを選択して、独自のBlueprintを作ることもできます。 SUSE AI Factory with NVIDIAというSUSE AI FactoryとNVIDIA AI Enterpriseを組み合わせた製品では、NVIDIAのAI Blueprintをもとにした「NVIDIA RAG」や「AI-Q Research Assistant」などのBlueprintが提供されています(参考: Accelerating the AI Journey: SUSE AI Factory with NVIDIA )。 SUSE AI Factoryのアーキテクチャ SUSE AI Factoryのアーキテクチャ図(出典: What are the building blocks of SUSE AI Factory? ) SUSE AI Factoryは3つの構成要素によって分けられています。 Foundation SUSE AI Factoryを動かすための土台です。 アーキテクチャ図の「SUSE Virtualization / bare metal / cloud solutions」、「SLES16 with NVIDIA GPU driver」、「RKE2 Kubernetes cluster」、「Rancher Manager」、「SUSE Storage」、「SUSE Security」、「SUSE Observability」、「GPU Operator」の部分になります。 ベアメタルまたはクラウド上のノードに展開し、ノードの展開にはSUSE Elementalの利用が推奨されています。 OSはSLESが推奨されていますが、Rancher Primeが動作するOSであれば、SUSE AI Factoryを利用することが可能です。 また、SUSE SecurityとSUSE Observabilityを利用することで、すべてのAIワークロードにわたって高度なセキュリティと高度な監視が可能です。 AI Factory Foundationの上で動く、KubernetesオペレーターとRancher PrimeのUI拡張です。 アーキテクチャ図の「AI Factory」の部分になります。 主な役割は以下の3つになります。 AI Libraryの個々のアプリを検索、インストール、管理する 特定のユースケース向けにアプリをまとめたBlueprintを検索、インストール、管理する 利用者が選んだアプリをもとに、独自のBlueprintを作成する Blueprints 特定のユースケースに必要なアプリをひとまとめにした、不変でバージョン管理されたスタックです。 アーキテクチャ図の「AI Blueprints」の部分になります。 AIワークロードは相互に連携する複数のアプリを必要とするため、それらを1つの単位にまとめ、ワンクリックでデプロイできるようにしています。 SUSE AI Factoryのアプリケーション SUSE AI Factoryでは、SUSEにより事前検証された、様々なOSSのAIアプリケーションを活用することで、セキュリティやデータ主権を維持しながらAIワークロード環境を迅速かつ簡易に構築・運用することが可能です。 SUSE AI Factoryで利用できるAIアプリケーションを紹介します。 推論エンジン 推論エンジンとは 推論エンジンは、学習済みのLLMをメモリに読み込み、入力に対して回答を生成する実行基盤です。生成AIスタックの中で、実際にGPUやCPUを使って計算する中心部分にあたります。 推論エンジンを利用することで、計算処理の高速化、メモリの節約、様々なハードウェアへの対応が可能になります。 参考: AIにおける推論とは何か 、 AI 推論とは vLLM vLLMは、本番環境向けのLLMをAPIとして提供するソフトウェアです。 主な特徴は以下になります。 PagedAttention :KVキャッシュ(LLMが文章を作成するための計算結果を保存したもの)を小さなブロックに分けて管理します。これによりGPUメモリの浪費を大幅に減らせます。 Continuous Batching :モデルAPIに対する複数のリクエストをまとめて処理しつつ、生成が終わったリクエストから順に新しいリクエストと入れ替えます。すべての完了を待たないため、GPUの空き時間が減ります。 テンソル並列 :1つのモデルを複数のGPUに分割して載せられます。1枚のGPUに収まらない大きなモデルも動かせます。 OpenAI互換のAPIサーバー :OpenAI互換のAPIを内蔵しているため、OpenAIのAPIを使う既存のアプリからも、接続先を変えるだけで利用できます。 Ollama Ollamaは、中小規模でLLMを手軽にダウンロード、実行、管理できるようにするツールです。 主な特徴は以下になります。 モデルライブラリ :「ollama pull」のようなコマンドで、公開されているモデルをすぐに取得できます。 Modelfile :ベースモデル、システムプロンプト(回答するLLMの役割やルールの指示)、パラメータを定義して、独自のモデル設定を作れます。 シンプルなAPI :独自のREST APIに加えて、OpenAI互換のAPIも提供しています。 vLLMとOllamaの比較 vLLMとOllamaを比較すると以下のようになります。 観点 vLLM Ollama 主な用途 本番運用 PoC、検証、小規模運用 強み 複数ユーザーからのリクエストの並列処理 手軽にモデルを実行・管理 導入のしやすさ 環境構築や設定時に専門知識が必要 インストーラーやコマンドで即座に起動可能 ベクトルDB ベクトルDBとは ベクトルDBは、文章や画像を数値のベクトルに変換して保存し、「意味が近いもの」を高速に検索するためのデータベースです。キーワードの一致ではなく意味の近さで探せるため、「返品の方法」という質問で「商品を送り返す手順」という文書を見つけるような検索ができます。 LLMでは、主にRAG(Retrieval-Augmented Generation)で使われます。 RAGとはLLMが回答を生成する際に、外部のデータベースや文書から関連情報を検索し、その情報を踏まえて生成する技術です。以下のような流れで生成します。 社内文書などをベクトルに変換してベクトルDBに保存する ユーザーの質問もベクトルに変換し、意味が近い文書をベクトルDBから取り出す 取り出した文書を質問と一緒にLLMへ渡し、回答を生成させる この仕組みにより、LLMが学習していない社内情報や最新情報をもとに回答できるようになります。 参考: ベクトルデータベースとは 、 RAG (検索拡張生成) とは何ですか? OpenSearch OpenSearchはOpenSearch Software Foundationが開発したOSSのベクトルDBの機能を兼ね備えた全文検索・分析エンジンです。 特徴としてはキーワード検索(全文検索)とベクトル検索を組み合わせたハイブリッド検索ができます。製品の型番や固有名詞のように「意味」より「文字列の一致」が大事な検索と、意味検索を両立したい場合に向いています。 参考: OpenSearch公式サイト 、 OpenSearch(GitHub) Milvus MilvusはZillizが開発した大規模なベクトル検索のために設計されたOSSのベクトルDBです。 特徴としてはクラウドネイティブな分散アーキテクチャです。リクエストを受け付けるアクセス層、全体を調整するコーディネーター、検索やデータ取り込みを行うワーカーノード、ストレージ層に役割が分かれており、それぞれを個別にスケールできます。 数十億件規模のベクトルも扱える設計のため、大規模なRAGや画像検索などに向いています。 参考: Milvus Architecture Overview 、 Milvus(GitHub) Qdrant Rustで実装された高速かつ省メモリなOSSのベクトルDBです。 特徴としてはベクトルにつけたメタデータによる絞り込みを検索と同時に効率よくできます。たとえば「2025年以降の、営業部の文書だけを対象に意味検索する」といった条件付きの検索が得意です。 単体でも動かしやすく軽量なため、小〜中規模のRAGに向いています。 参考: Qdrant公式ドキュメント 、 Qdrant(GitHub) OpenSearchとMilvusとQdrantの比較 観点 OpenSearch Milvus Qdrant 主な用途 全文検索・分析エンジン + ベクトルDB 大規模処理向けのベクトルDB 高速・省メモリなベクトルDB 強み ハイブリッド検索(キーワード一致 + 意味検索) 大量ベクトルの並列処理 高度なフィルタ検索 構成の規模 中規模向け 大規模向け 小〜中規模向け 導入のしやすさ 普通 本番運用に向けた大規模構成は複雑 手軽 フロントエンド OpenWebUI Open WebUIは、LLMと対話するためのセルフホスト型のWebインターフェースです。 ChatGPTのような画面でモデルを選んでチャットでき、外部のクラウドサービスに依存せず、完全にオフラインでも動作するように設計されています。したがって、社内のデータを外に出さずに生成AIを使うことができます。 OpenWebUIの詳しい機能は別記事で投稿予定です。 参考: Open WebUI公式ドキュメント 、 Open WebUI(GitHub) LLM連携・ゲートウェイ LiteLLM LiteLLMは、BerriAIが開発している、さまざまなLLMのAPIをOpenAI形式のインターフェースで統一して呼び出すためのOSSです。 Proxy Serverとして以下の機能が利用できます。 複数のLLMへのルーティングと負荷分散、障害時には別のLLMへの自動切り替えが可能 予算の上限やレート制限(一定時間あたりのリクエスト数の上限)の設定 利用量やコストの記録、MLflowやLangfuseなどの監視ツールへのログ連携 参考: LiteLLM公式ドキュメント 、 LiteLLM(GitHub) mcpo mcpoは、MCP(Model Context Protocol)サーバーを、OpenAPI準拠のREST APIとして公開するプロキシです。Open WebUIのプロジェクトが開発しています。 MCPは、LLMが外部のツールやデータソースを呼び出すための標準プロトコルになります。ただし、MCPサーバーの多くは標準入出力で通信する形式のため、そのままではWebアプリから直接呼び出しにくいという課題があります。 MCPサーバーをmcpo経由で起動すると、各ツールがHTTPのエンドポイントとして公開され、OpenAPIのドキュメントも自動で生成されます。HTTPの一般的な認証やネットワーク制御もそのまま使えます。 参考: mcpo(GitHub) 、 Model Context Protocol公式サイト ML開発・MLOps MLOpsとは MLOpsは、機械学習モデルの開発から本番運用までを、継続的かつ再現可能に回していくための考え方と仕組みです。アプリ開発でいうDevOps(開発と運用が連携し、改善とリリースを継続的に回す考え方)の機械学習版にあたります。 詳しくはこのブログ記事を参考にしてください。 Red Hat OpenShift AIとは? PyTorch PyTorchは、深層学習モデルを構築・学習するためのOSSのフレームワークです。 以下の特徴があります。 プログラムの実行時にリアルタイムで計算グラフ(処理の流れ)を構築可能 複数GPUを利用して、大きなAIモデルの分散学習が可能 NVIDIA GPUだけでなく、AMD GPU、Apple Silicon、Intelなどの多様なハードウェアに対応 参考: PyTorch公式サイト 、 PyTorch(GitHub) 、 Understanding PyTorch’s Dynamic Computational Graphs 、 What is PyTorch? MLflow MLflowは、機械学習のライフサイクルを管理するためのOSSプラットフォームです。近年は生成AI向けの機能も追加されています。 主な機能は以下になります。 Tracking & Experiments :実験ごとのパラメータ、評価指標(メトリクス)、成果物(アーティファクト)を記録し、管理する Model Registry :モデルのバージョンとライフサイクルを一元管理する Model Deployment :学習したモデルを本番環境へデプロイする ML Library Integrations :主要な機械学習ライブラリとネイティブに連携する Model Evaluation :モデルの性能を評価し、検証する 参考: MLflow公式ドキュメント 、 MLflow(GitHub) Kubeflow(テックプレビュー) Kubeflowは、Kubernetes上で機械学習のワークフロー全体を動かすためのOSSプラットフォームです。 以下のサブプロジェクトが集まって構成されています。 Notebooks :Jupyter(ブラウザ上で動く開発環境)などの開発環境をKubernetes上で提供する Pipelines :前処理、学習、評価といった工程をパイプラインとして定義し、自動実行する Trainer :PyTorchなどを使った分散学習をKubernetes上で実行する Katib :ハイパーパラメータ(学習率など、学習前に人が決める設定値)の自動チューニングを行う Hub :学習したモデルのメタデータやバージョンを管理する KubeflowはSUSE AI Factoryでは2026年10月現在テックプレビューとして提供されています。本番環境で使う前に、サポート範囲を確認してください。 参考: Kubeflow公式ドキュメント 、 Kubeflow brings MLOps to the CNCF incubator(CNCFブログ) 、 Installing applications from AI Library(Kubeflowのテクノロジープレビューについて) おわりに 本記事ではSUSE AI Factoryの各コンポーネントとAI Libraryに含まれる各アプリケーションを紹介しました。 OpenWebUI、推論エンジン、ベクトルDBを利用すればRAG搭載のAIチャットWebUIが利用でき、LiteLLMやmcpoを利用すると複数モデルの連携が可能になります。さらに、MLOpsのツールを組み合わせることにより、モデルの利用だけでなく、開発も可能になります。 SUSE AI Factoryを利用することで、これらの紹介したアプリケーションをBlueprintによって簡単に構成することが可能になります。 これからもSUSE AIを紹介する記事を発信していくので、興味を持っていただけたら幸いです。 参考 Installing applications from AI Library(SUSE AI 1.0) Why use SUSE AI Factory? What are the building blocks of SUSE AI Factory? Using SUSE AI Factory How do I prepare for the deployment?(Deploying SUSE AI Factory) SUSE AIとSUSE AI Factoryとは?(SIOS Tech Lab) ご覧いただきありがとうございます! この投稿はお役に立ちましたか? 役に立った 役に立たなかった 0人がこの投稿は役に立ったと言っています。 The post SUSE AI Factoryを構成するAIアプリケーション徹底解説 〜OSSで構築するエンタープライズ生成AI基盤〜 first appeared on SIOS Tech Lab .
1. はじめに はじめまして、NTTデータの菊地です。 普段はデータ分析やデータ活用に関する業務に携わっています。 Dataikuについては、業務をきっかけにほぼ初心者の状態から学習を始めました。 Dataikuに興味を持ったものの、 「そもそも何ができるの?」 「何から学習すればいい?」 「どこまで学べば、ある程度使えるようになる?」 と迷う方も多いのではないでしょうか。 私自身も同じ状態からスタートし、公式Learning Pathを中心に学習して、以下の認定資格を取得しました。 ・Core Designer ・ML Practitioner ・Advanced Designer
2026 年 9 月 21 日週を表現するテーマが 1 つあるとすれば、「選択」ではないでしょうか。フロンティアモデルが次々と生み出される中、関心はもはや「モデルがどれほど賢いか」だけではなくなり、「このコストで、このレイテンシーで、このステップに合うモデルはどれか」になっています。 その関心に応えるモデルが、ここ数日間にわたって Amazon Bedrock に導入されました。知能と効率の対比曲線に 2 つの新たな選択肢を提供する OpenAI の GPT-6 Sol と GPT-6 Luna 、および Anthropic の Claude 5.5 ファミリー第一弾となる Claude Opus 5.5 です。 GPT-6 Sol は開発と運用における要件の厳しい反復的な作業向けに構築されており、GPT-6 Luna は的を絞った反復可能なタスクの大規模な実行を実用レベルに引き下げます。そして、どちらのモデルも前世代の GPT-5.6 からの大幅な低価格化を実現しています。一方、Claude Opus 5.5 は、Opus 5 よりも少ないトークンでより多くの処理をこなし、エージェンティックコーディングや長時間実行されるタスク向けにチューニングされています。私は、3 つのモデルのすべてが、毎回最も大きなモデルを選択するのではなく、モデルと作業をマッチさせるという同じ考え方に向かっている点がすばらしいと感じています。もう 1 つの話題は、このエージェンティックワールドにオブザーバビリティが追いついてきているということです。これには、私自身が執筆したリリース情報も含まれます。 それでは、9 月 28 日週の AWS ニュースを見ていきましょう… 9 月 21 日週のリリース 9 月 21 日週のリリースのうち、私が注目したものをいくつかご紹介します。 Amazon CloudWatch Omni の導入 – アプリケーションと AI エージェントの両方を単一のコラボレーションエクスペリエンスで観察できるようになりました。 Amazon CloudWatch Omni は OpenTelemetry 上に構築されているため、既存のテレメトリは再設定する必要がない状態で表示されます。また、チーム全体がエンタープライズ SSO を使用して 1 つの URL からアクセスするので、コンソールアクセスは必要ありません。サービスを自動検出し、依存関係をマッピングするとともに、 AWS DevOps エージェント を調査セッションに導入してシグナルを関連付け、根本原因を突き止めます。エージェントオブザーバビリティの側面に関する 関連記事 、AI 時代のオブザーバビリティとはどのようなものかを説明する AWS Cloud Operations ブログの詳しい解説記事 、具体的な詳細に関する 最新情報での発表 をご覧ください。全体像を把握したいなら、正確性を実行レベルで測定しなければならない理由に関する Matt Wood の「 壊れているのではなく、間違っている 」がお勧めです。 Amazon EventBridge の拡張カスタムイベントバス – Amazon EventBridge で、チームやアカウント間でイベント駆動アプリケーションをスケーリングする組織専用に構築された拡張カスタムイベントバスの提供が開始されました。AWS RAM を通じて、組織内のすべてのアカウント間で共有される単一の一元化されたバスをデプロイできるようになりました。これには、オプションのイベント順序付けのほか、フィルタリング、ターゲット、再試行をバンドル化する簡素化されたサブスクライバーリソース、コンテンツベースの重複排除、 AWS Lambda などのターゲットの同期呼び出しといった機能が備わっています。マルチバスセットアップの累積するクロスアカウントルーティング料金が新しいイングレス/エグレス料金モデルに置き換えられ、既存のバスは「クラシック」として引き続き以前と同様に機能します。 Amazon SageMaker HyperPod 推論ゲートウェイ – アプリケーションを一切変更せずに単一の Amazon EKS マネージドアドオンとしてデプロイされる Kubernetes ネイティブの GPU 認識ルーティングレイヤーを使用して、LLM 推論を Amazon SageMaker HyperPod の前段に配置できるようになりました。ラウンドロビン型の負荷分散の代わりに、リアルタイムの推論シグナル (KV キャッシュ使用率、キュー深度、プレフィックスキャッシュヒット、予測レイテンシーなど) に基づいてルーティングすることで、混合ハードウェアシナリオやバーストが発生するシナリオでのファーストトークンレイテンシーを最大 82% 削減します。この推論ゲートウェイは、vLLM と SGLang を含めたすべての OpenAI 互換モデルサーバーで動作します。 AWS End User Messaging と Amazon SES 向けの AI エージェントスキル – 平易な言葉を使って AI コーディングエージェントに指示することで、メッセージを作成して送信できるようになりました。 Amazon SES と AWS End User Messaging は、AWS MCP サーバー用の AI エージェントスキルを公開することで、送信 ID の検証、本番用 E メールの送信、カードとボタンを使用するブランド化された RCS エージェントの作成といったタスクに関する検証済みのステップバイステップガイダンスをエージェントに提供します。これらのスキルは Claude Code、Codex、Cursor、Kiro で動作するため、ドキュメントやコンソール画面を行き来することなくメッセージングワークフローを完了できます。 AWS のお知らせに関する詳しいリストについては、「 AWS の最新情報 」ページをご覧ください。 AWS のその他のニュース 皆さんが興味を持つと思われるその他の記事とリソースをいくつかご紹介します。 Strands ハーネスの導入 – Strands Agents チームが Strands ハーネスをリリースしました。このハーネスは、構築済みの汎用エージェントハーネスで、Apache 2.0 に基づいてローカルで実行、または任意の場所にデプロイできます。Python または TypeScript のコードを 1 行記述するだけで、Amazon Bedrock、Anthropic、OpenAI、Google のモデルやローカルの Ollama モデルに接続できます。これは、プロンプトキャッシュとコンテキスト管理 (肥大化したツール結果の切り捨て、コンテキストウィンドウが満杯になったときの圧縮、実行間でのメモリの保持) のための実用的なデフォルト設定が行われた状態で提供されます。チームは、同じモデルの同等のハーネスよりもコストが約 28% 低く、精度も一定に保たれていると報告しています。 2026 年 Gartner Magic Quadrant がコンテナ管理部門のリーダーとして AWS を選出 – Gartner は、4 年連続で AWS をリーダーに認定しました。コンテナが AI エージェントを構築して実行する方法のデフォルト基盤になりつつある中、この記事では、 Amazon ECS Express Mode と Amazon EKS Auto Mode から EKS プロビジョンドコントロールプレーンでの 99.99% の可用性 SLA におよぶ、コンテナに関する今後の見通しがわかりやすく説明されています。 AI に関する新しい AWS Reimagine レポートの発表 – AWS Executive in Residence チームは、9 か月にわたって 27 か国 154 人のリーダーを取材し、AI を価値に変える組織とそうでない組織の違いについてインタビューしました。この レポート は偏見のない内容になっており (Amazon で AI がうまく機能しなかった分野も含まれます)、構築が高速化するとボトルネックが意思決定、資金調達、作業のガバナンスに移行するというインサイトを繰り返し報告しています。チームが実際に AI をどのように導入するかについて考えているなら、一読の価値があります。 AWS のブログ記事の詳細な一覧については、 AWS ブログ ページをご確認ください。 近日開催予定の AWS イベント カレンダーを確認して、近日開催予定の AWS イベントにサインアップしましょう。 AWS re:Invent – AWS re:Invent がラスベガスに戻ってきます。期間は 11 月 30 日から 12 月 4 日で、セッション時間、場所、講演者が既に公開済みです。指定席の予約は 10 月 6 日に開始されます。 今すぐ登録して 、チョークトーク、ワークショップ、ビルダーズセッションに参加する準備をしましょう。 AWS Summit – re:Invent が間近に迫る中、今年の Summit も終わりに近づいています。最後の Summit は ドバイ (9 月 30 日) の Dubai World Trade Center で開催され、60 以上のセッション、AWS Village、ハンズオンワークショップに参加できます。 AWS Community Day – コミュニティリーダーが企画および提供するコミュニティ主導のカンファレンスです。今後のイベントには、 英国の ComSum Manchester (10 月 1 日) と イタリアの AWS Community Day Italy (10 月 2 日) があります。 AWS Builder Center に参加して、ビルダーとつながり、ソリューションを共有し、開発をサポートするコンテンツにアクセスしましょう。 こちら から、今後開催されるすべての AWS 主導の対面イベントおよび仮想イベントとデベロッパー向けのイベントをご覧いただけます。9 月 28 日週のニュースは以上です。10 月 5 日週の Weekly Roundup もお楽しみに! – Daniel Abib 原文は こちら です。



















