「Apache Spark」に関連する技術ブログ - TECH PLAY

TECH PLAY

Apache Spark」に関連する技術ブログ

156 件中 1 - 15 件目
本記事は 2026 年 8 月 28 日 に公開された「 Razor Group’s journey to a modern data lakehouse on AWS 」を翻訳したものです。 Razor Group は、複数のグローバルマーケットプレイスで 250 以上のブランドを展開する、欧州有数の EC アグリゲーターです。売上高は 4 億ドルを超え、ダイナミックプライシングや在庫最適化から広告費の配分、サプライチェーンの制御に至るまで、あらゆる重要な経営判断をデータで支えています。 事業の中心にあ
本記事は 2026 年 4 月 15 日 に公開された「 Get to insights faster using Notebooks in Amazon SageMaker Unified Studio 」を翻訳したものです。 本記事では、Amazon SageMaker Unified Studio のノートブックがインフラの設定を簡素化し、インサイト獲得までの時間を短縮する仕組みを紹介します。住宅価格データの分析、スケーラブルなデータテーブルの作成、分散プロファイリング、機械学習 (ML) モデルの
本記事は 2026 年 8 月 26 日 に公開された「 AWS and DuckLabs: Building the future of analytics together 」を翻訳したものです。 本日、 Amazon が DuckLabs を買収する最終契約を締結したこと を発表します。DuckLabs はオープンソースの分析データベース DuckDB を開発する、アムステルダム拠点の企業です。取引は通常のクロージング条件が満たされ次第、まもなく完了する見込みです。DuckDB を開発し DuckL
2026 年 8 月 21 日、 AWS Glue 6.0 の一般提供について発表しました。これにより、価格が以前の AWS Glue バージョンよりも 30% 低くなり、 Apache Iceberg v3 の機能が完全にサポートされるようになりました。AWS Glue 6.0 は、完全に近代化されたランタイム、Apache Spark 4.1、Python 3.12、および Scala 2.13 に基づいて構築されており、より高速なパフォーマンスを実現しています。 このリリースにより、AWS Glue
~Vertex AIからAgent Platformへ。試験を通して理解したGoogle Cloud AI/MLの現在地~ はじめに 先日、Google CloudのProfessional Machine Learning Engineer(PMLE)試験に合格し、約2年ぶりに資格を更新しました。これにより、保有するGoogle Cloud認定資格の「全冠」も維持することができました。 本記事では、今回の受験を通じて感じた 「Google Cloud認定試験の変化」 に加え、試験勉強を通じて改めて整理で
本記事は 2026 年 3 月 23 日 に公開された「 Extract data from Amazon Aurora MySQL to Amazon S3 Tables in Apache Iceberg format 」を翻訳したものです。 Amazon Aurora MySQL-Compatible Edition でデータを管理していて、分析や機械学習 (ML)、サービス横断のクエリに活用できるモダンなレイクハウス形式で利用可能にしたい、という方は多いのではないでしょうか。 組織では分析の実行、
チューリングの MLOps エンジニアの岩政です。 チューリングでは、センサ入力から車両の将来の行動を一貫して推定する学習ベースのモデルとして End-to-End (E2E) 自動運転 AI を開発しています。E2E 自動運転 AI の学習にはデータセットが必要です。私の所属する MLOps チームが、これを作成するためのデータ基盤の開発を行っています。 MLOps チームでは車両に搭載したカメラなどのセンサから走行データを収集し、Data Lake に格納しています。更に ETL (Extract,
はじめに こんにちは、開発1部でデリッシュキッチンの開発をしている蜜澤です。 現在データ基盤はDatabricksを使用しており、データはUnity Catalog(以下UC)のテーブルです。 UCのテーブルをプロダクトのAPIから配信したいという状況が直近の1年で増えてきました。 例えば、「レコメンド結果をアプリの画面に出したい」「集計したアプリのログデータを分析できる社外向けのダッシュボードツールを作成したい」といった要望があります。 これをアプリ側から読めるようにするには、UCのテーブルのデータをA
タイトルとSEO、書いた後で毎回止まってませんか ども!龍ちゃんです。 ブログの執筆自体はサクッと進むんですが、タイトルとメタディスクリプションで毎回手が止まる経験ありませんか。SEOといわれても、じゃあ何をどう詰めればいいのか分からない。結局「まあこれでいいか」で、勢いに任せて投稿しています。 正直に言うと、ここが一番苦手な工程です。コードも本文も書けるのに、マーケっぽい言葉選びとかクリック率の感覚が要るこの仕上げに関しては難しいですね。そこに対するモチベが一切ないのが問題なのですが、せっかく公開するな
はじめにLINEヤフーで大規模データ処理基盤の開発を担当している浅沼と楊です。この記事では、秒間数万リクエストを処理する社内の HDFS(Hadoop Distributed File System)...
報告者:柾本 彬(技師 / 技術推進グループ・softcreate)  会期:2026年6月2日(火)〜3日(水) 会場:Fort Mason Center マイクロソフトが毎年開催している開発者向けイベント「Microsoft Build 2026」に参加してきました。ガチガチの技術レポートは参加した各社の優秀なエンジニアの方々が書いてくれていますし、同行した若き?エンジニア達も書いてくれそうなので一旦置いておいて、「現地に行って参加するってこんな感じなんだなぁ」というレポートをさせていただきます! 個
LINEヤフーの技術カンファレンス「Tech-Verse 2026」の公式記事です。はじめにこんにちは。LINEヤフーで大規模データ基盤の運用を担当している平山、沼田、小笠原、小川です。LINEヤフー...
みなさんこんにちは!ワンキャリアのプロダクト開発部 ワンキャリア転職チームの越川(X:@kosshii_)です。 前回は、プロダクト開発チームのエンジニア4名に「学びになった技術書トップ3」を聞いてみました。新卒エンジニアの「本を読んで勉強したいけど、何から読めばいいかわからない」という悩みに寄り添った記事になっておりますので、是非、本記事と一緒にご一読いただきたいです! ▼ Part1はこちら
はじめに 前回の記事では、Apache Spark(以下Spark)からApache Iceberg(以下Iceberg)に対してMERGE INTOを実行する際に、ON句でtarget側のデータを絞り込むことで、shuffleに流れ込むデータ量を減らす方法を確認しました。 https://zenn.dev/kentyy/articles/485a2b368370bc しかし、データの特性上ON句でtarget側のデータ量を絞り込めない場合もあります。またJOIN自体は無くならないため、source側のデ
G-gen の杉村です。2026年4月に発表された、Google Cloud や Google Workspace のイチオシアップデートをまとめてご紹介します。記載は全て、記事公開当時のものですのでご留意ください。 はじめに Google Cloud Next '26 の開催 プロダクトの名称変更 概要 Looker Studio → Data Studio(和名: データポータル) Dataplex Universal Catalog → Knowledge Catalog Cloud Compose

ブログランキング

集計期間: 2026年8月30日 2026年9月5日

タグからブログをさがす

ソフトウェア開発

GitHubDevOpsXamarinSketch

プログラミング

ElectronElmNuxt.jsC++

TECH PLAY でイベントをはじめよう

グループを作れば、無料で誰でもイベントページが作成できます。 情報発信や交流のためのイベントをTECH PLAY で公開してみませんか?
無料でイベントをはじめる