「Apache Spark」に関連する技術ブログ - TECH PLAY

TECH PLAY

Apache Spark」に関連する技術ブログ

152 件中 1 - 15 件目
~Vertex AIからAgent Platformへ。試験を通して理解したGoogle Cloud AI/MLの現在地~ はじめに 先日、Google CloudのProfessional Machine Learning Engineer(PMLE)試験に合格し、約2年ぶりに資格を更新しました。これにより、保有するGoogle Cloud認定資格の「全冠」も維持することができました。 本記事では、今回の受験を通じて感じた 「Google Cloud認定試験の変化」 に加え、試験勉強を通じて改めて整理で
本記事は 2026 年 3 月 23 日 に公開された「 Extract data from Amazon Aurora MySQL to Amazon S3 Tables in Apache Iceberg format 」を翻訳したものです。 Amazon Aurora MySQL-Compatible Edition でデータを管理していて、分析や機械学習 (ML)、サービス横断のクエリに活用できるモダンなレイクハウス形式で利用可能にしたい、という方は多いのではないでしょうか。 組織では分析の実行、
チューリングの MLOps エンジニアの岩政です。 チューリングでは、センサ入力から車両の将来の行動を一貫して推定する学習ベースのモデルとして End-to-End (E2E) 自動運転 AI を開発しています。E2E 自動運転 AI の学習にはデータセットが必要です。私の所属する MLOps チームが、これを作成するためのデータ基盤の開発を行っています。 MLOps チームでは車両に搭載したカメラなどのセンサから走行データを収集し、Data Lake に格納しています。更に ETL (Extract,
はじめに こんにちは、開発1部でデリッシュキッチンの開発をしている蜜澤です。 現在データ基盤はDatabricksを使用しており、データはUnity Catalog(以下UC)のテーブルです。 UCのテーブルをプロダクトのAPIから配信したいという状況が直近の1年で増えてきました。 例えば、「レコメンド結果をアプリの画面に出したい」「集計したアプリのログデータを分析できる社外向けのダッシュボードツールを作成したい」といった要望があります。 これをアプリ側から読めるようにするには、UCのテーブルのデータをA
タイトルとSEO、書いた後で毎回止まってませんか ども!龍ちゃんです。 ブログの執筆自体はサクッと進むんですが、タイトルとメタディスクリプションで毎回手が止まる経験ありませんか。SEOといわれても、じゃあ何をどう詰めればいいのか分からない。結局「まあこれでいいか」で、勢いに任せて投稿しています。 正直に言うと、ここが一番苦手な工程です。コードも本文も書けるのに、マーケっぽい言葉選びとかクリック率の感覚が要るこの仕上げに関しては難しいですね。そこに対するモチベが一切ないのが問題なのですが、せっかく公開するな
はじめにLINEヤフーで大規模データ処理基盤の開発を担当している浅沼と楊です。この記事では、秒間数万リクエストを処理する社内の HDFS(Hadoop Distributed File System)...
報告者:柾本 彬(技師 / 技術推進グループ・softcreate)  会期:2026年6月2日(火)〜3日(水) 会場:Fort Mason Center マイクロソフトが毎年開催している開発者向けイベント「Microsoft Build 2026」に参加してきました。ガチガチの技術レポートは参加した各社の優秀なエンジニアの方々が書いてくれていますし、同行した若き?エンジニア達も書いてくれそうなので一旦置いておいて、「現地に行って参加するってこんな感じなんだなぁ」というレポートをさせていただきます! 個
LINEヤフーの技術カンファレンス「Tech-Verse 2026」の公式記事です。はじめにこんにちは。LINEヤフーで大規模データ基盤の運用を担当している平山、沼田、小笠原、小川です。LINEヤフー...
みなさんこんにちは!ワンキャリアのプロダクト開発部 ワンキャリア転職チームの越川(X:@kosshii_)です。 前回は、プロダクト開発チームのエンジニア4名に「学びになった技術書トップ3」を聞いてみました。新卒エンジニアの「本を読んで勉強したいけど、何から読めばいいかわからない」という悩みに寄り添った記事になっておりますので、是非、本記事と一緒にご一読いただきたいです! ▼ Part1はこちら
はじめに 前回の記事では、Apache Spark(以下Spark)からApache Iceberg(以下Iceberg)に対してMERGE INTOを実行する際に、ON句でtarget側のデータを絞り込むことで、shuffleに流れ込むデータ量を減らす方法を確認しました。 https://zenn.dev/kentyy/articles/485a2b368370bc しかし、データの特性上ON句でtarget側のデータ量を絞り込めない場合もあります。またJOIN自体は無くならないため、source側のデ
G-gen の杉村です。2026年4月に発表された、Google Cloud や Google Workspace のイチオシアップデートをまとめてご紹介します。記載は全て、記事公開当時のものですのでご留意ください。 はじめに Google Cloud Next '26 の開催 プロダクトの名称変更 概要 Looker Studio → Data Studio(和名: データポータル) Dataplex Universal Catalog → Knowledge Catalog Cloud Compose
はじめに Apache Spark(以下Spark)からApache Iceberg(以下Iceberg)に対して、MERGE INTOを実行するユースケースは、差分更新やCDC(Change Data Capture)の取り込み、冪等性の担保においてよく使われます。実際にupsertを実現したいという要件から、MERGE INTOが利用できるIcebergを選択するケースもあります。 一方で、MERGE INTOは単純なINSERTやUPDATEと比較して、処理が複雑です。内部的にはsourceテーブル
G-gen の佐々木です。当記事では、Google Cloud Next '26 で発表された BigQuery に関する新機能について、公式の投稿記事「 What’s new in BigQuery: Powering the Agentic Era 」の内容をもとに紹介します。 はじめに Open, cross-cloud lakehouse Managed Iceberg Tables(GA) Iceberg REST Catalog の読み書き相互運用性(Preview) Cross-Cloud
こんにちは、クロスイノベーション本部リーディングエッジテクノロジーセンターの山下です。 最近は、gpt-ossやQwen3.5といったローカルLLM(Local Large Language Model)も注目されており、これらを活用したプロジェクトも増えてきています。 今回の記事では、ローカルLLMのベンチマークソフトウェアである GuideLLM について紹介します。LLMの性能には様々な観点がありますが、GuideLLMはLLMサーバ自体の応答速度などを測るためのベンチマークソフトウェアです。 Gu
こんにちは。SCSKの岡尾です。 皆さん、S3 Tablesについてご存じでしょうか。 AWS re:Invent 2024で発表され、話題を呼んだ新機能「 Amazon S3 Tables 」。データレイクの構築・運用を根本から変えるポテンシャルを秘めたこのサービスについて、「実際にどう使えるの?」「既存のS3バケットと何が違うの?」と気になっている方も多いのではないでしょうか。 本記事では、S3 Tablesの基本的な概要を紹介しつつ、実際にS3 Tablesへのデータ連携(ETL処理)を実装する中で