「Snowflake」に関連する技術ブログ - TECH PLAY

TECH PLAY

Snowflake」に関連する技術ブログ

247 件中 46 - 60 件目
はじめに はじめまして。NTTデータでデータサイエンティストを務めております池野です。 本記事では、Databricks Assistantを活用して需要予測モデルを構築してみた内容をご紹介します。 内容に少しボリュームがあるため、前編・後編の2部構成でお届けします。 前編:背景・コンセプト整理からEDA(探索的データ解析)、需要要因の仮説出しまで 後編:特徴量設計、ベースライン構築、機械学習モデル構築、振り返りまで 需要予測はビジネスインパクトの大きいテーマですが、実務では前処理やEDA、特徴量設計など
こんにちは、SCSKの松岡です🪣 データ基盤の構築でIceberg (S3 Tables)を導入した際の試行錯誤を整理しました。 従来のS3によるファイル格納型のデータレイクと比較し、Icebergを採用することで得られたメリットや、それをマネージドで扱えるS3 Tablesの利便性について紹介します。   背景 データ活用基盤におけるデータレイクは、単にデータを蓄積するだけでなく、直接参照して検索・分析に活用したいというニーズが増えています。そのような用途では、複数テーブルのJOINや同時アク
こんにちは、SCSK林です! モダンなシステムアーキテクチャにおいて、システム間を「疎結合」に保つことはもはや定番です。AWSにおいてその中心を担うのは、Amazon SQSやAmazon Managed Streaming for Apache Kafka (MSK)といったメッセージングサービス、あるいはAmazon S3を用いたバッファ層などかと思います。 ただ、実際のエンタープライズ領域におけるデータ連携案件、特にマルチクラウド構成やオンプレミスとの閉域網接続が絡むプロジェクトでは、単に「サービス
こんにちは、SCSK林です! 今回は、AWS、Snowflakeで実現したニアリアルタイムデータ連携について解説します。 本記事では、実際に構築した例をベースにアーキテクチャ選定の背景と、構成や技術的に気をつけるポイントについて共有していきたいと思います。   構成の背景(いわゆる要件) 今回の主要件は、オンプレミスのシステムから出力される業務データを、AWSを経由してSnowflakeへ連携し、数分以内(ニアリアルタイム)に分析可能にすることでした。 主な要件と制約は以下の通りです。 セキュリ
はじめに:データ活用の理想と現実、そして進化するガバナンスの系譜 「データ駆動型経営」や「デジタルトランスフォーメーション(DX)の推進」が企業の至上命題となる中、多くの企業は依然としてデータからビジネス価値を創出するプロセスにおいて、大きな壁に直面しています。データサイエンティストが高度なAIモデルを構築し、経営層がデータドリブンな意思決定を目指す一方で、基盤となる「データ」そのものの管理と統制が追いついていないことが、プロジェクトの重大なボトルネックとなっています。 「経営会議において、営業部門とマー
本記事は 2026 年 1 月 12 日 に公開された「 Navigating architectural choices for a lakehouse using Amazon SageMaker 」を翻訳したものです。 組織がデータを活用して意思決定やイノベーションを推進する動きは加速しています。ペタバイト規模の情報を扱う中で、従来はデータレイクとデータウェアハウスという 2 つの異なるパラダイムに分かれてきました。それぞれ特定のユースケースに強みがある一方、データ資産間に意図しない障壁を生むことが
こんにちは、技術戦略部CTOブロックの塩崎です。 当社ZOZOには1人あたり月額200ドルの基準のもと、Claude CodeやGemini CLIをはじめとした各種AI開発ツールを利用可能にする制度を2025年7月にスタートさせました。 corp.zozo.com 現在ではこの制度を用いて数百名という非常に多くの社員がClaude Codeを利用しています。このような中で組織全体のAI活用を推進するためには、それぞれの社員や部署のClaude Codeの利用状況をモニタリングすることが重要です。そのため
! この記事はSnowflake公式仕様の解説ではありません。内部実装の詳細は公開されていないため、実験で観測できた事実とサポート回答をもとに考察しています。 はじめに Snowflake Intelligenceを検証する中で、ひとつの課題に直面しました。 KPIである「会員売上率(=会員売上 ÷ 全体売上)」を算出しようとすると、 計算自体はシンプルにもかかわらず、実行方法(直接実行か、Intelligence経由か)によって結果が安定しないケースがあったのです。 業務利用を考えると、KPIの数値が実
本記事は 2025 年 12 月 16 日 に公開された「 Reference guide for building a self-service analytics solution with Amazon SageMaker 」を翻訳したものです。 今日の組織は、データレイク、データウェアハウス、SaaS アプリケーション、レガシーシステムなど、複数のサイロに分散したデータという重大な課題に直面しています。データの分断により、顧客の全体像の把握、業務の最適化、リアルタイムなデータドリブンの意思決定が困
現代のビジネスにおいて、AI(人工知能)や機械学習の活用は、単なる効率化の手段を超え、企業の競争優位性を決定づける核心的な戦略となりました。しかし、多くの企業がAIの実装を急ぐ中で、かつてないほど巨大な壁に直面しています。それが、複雑化したデータの「統治」と「品質」、すなわち統合データガバナンスの欠如です。 これまでのデータ管理は、システムの安定稼働を優先するIT部門による「守り」と、機動力を求める事業部門による「攻め」の二極化が進み、その溝がデータのサイロ化やブラックボックス化を招いてきました。しかし、
はじめに 2025年5月、dbt Labs から新しい実行エンジン dbt Fusion のpublic beta がリリースされました。現在はGA(General Availability)に向けた動きも進んでいます。 dbt Fusion による実行速度の向上やSQLの理解力強化については、すでに多くの場で紹介されていますが、個人的にはデータ分析基盤の拡張において避けて通れない「ELTパイプラインの変更」への寄与に着目しています。 そこで本記事では、dbt Fusion が提供する変更関連の機能に絞り
1. はじめに:なぜ「ただ並列化」しても速くならないのか? Snowparkを用いてデータ分析や加工を行っていると、処理時間の長さがボトルネックになる場面に直面します。その際、「Pythonなのだから並列化すれば速くなるはずだ」と考えるのは自然な発想でしょう。 しかし実際に実装してみると、次のような問題に遭遇することがあります。 マルチプロセス(Joblib)で高速化を試みたところ、PicklingError が発生する マルチスレッド化しても、処理時間がほとんど変わらない(場合によっては遅くなる) その
はじめに 皆さんこんにちは!九州大学修士1年の羽田野武蔵です! 2025年12月に、マッチングアプリ ...
はじめに はじめまして。NTTデータでデータサイエンティストを務めております池野です。 本記事では、DataRobot の生成AIを活用したアプリケーションである「データと会話する」エージェントを使って、商品の売り上げデータをインプットに、対話的に商品の需要傾向を確認する方法や、その使用感をお伝えしたいと思います。 DataRobotとは DataRobot社は、AIに対するユニークなコラボレーション型のアプローチによってユーザーをAIサクセスに導くバリュー・ドリブン AIのリーダーです。 https:/
はじめに 今回は機械学習プラットフォーム「DataRobot」のデモ紹介記事として、フィルム製品製造時の不良発生に影響する要因分析についての活用事例を紹介します。 DataRobotについて DataRobot社は、AIに対するユニークなコラボレーション型のアプローチによってユーザーをAIサクセスに導くバリュー・ドリブン AIのリーダーです。 https://www.datarobot.com/jp/ DataRobot社の製品であるDataRobotは、10年以上にわたってユーザーの自動機械学習(Aut