データエンジニアは、ワークロードが変動する大規模データセットに対してSQLクエリを処理する必要があります。ワークロードは、インフラストラクチャの管理やプロビジョニングを行うことなく、クエリ量に基づいて自動的にスケーリングされる必要があります。ソリューションはコスト効率が高く、クエリ実行中に使用されたコンピューティングリソースに対してのみ課金される必要があります。
データエンジニアはどのコンピューティングオプションを使用すべきでしょうか?
ELTプロジェクトに新しいデータエンジニアリングチームが配属されました。この新しいデータエンジニアリングチームは、プロジェクトを完全に管理するために、テーブル「sales」に対する完全な権限を必要とします。
新しいデータエンジニアリングチームにデータベースに対する完全なアクセス権限を付与するには、どのコマンドを使用すればよいですか?
データエンジニアが、クラウドストレージを利用するDatabricksプロジェクトに取り組んでいます。このデータエンジニアは、ストレージアカウントにJSONファイルが到着したらすぐに、ストレージアカウント上のコンテナから複数のJSONファイルをロードしたいと考えています。
データエンジニアは、まずファイルをデータフレームに読み込み、Pythonを使用して期待どおりに動作していることを確認するために、どの構文に従うべきでしょうか?
データエンジニアが、パートナー企業にDatabricksアカウントの使い方を説明しています。両チームはいくつかの共通のビジネスユースケースを共有しています。データエンジニアは、Unityカタログで管理されているデルタテーブルと、それらのテーブルを作成するノートブックジョブの一部をパートナー企業と共有する必要があります。
データエンジニアは、必要な情報をどのようにして円滑に共有できるのでしょうか?
Structured Streaming が処理の正確な進行状況を確実に追跡し、再起動や再処理によってあらゆる種類の障害に対処できるようにするには、Spark が各トリガーで処理されるデータのオフセット範囲を記録するために使用する次の 2 つのアプローチのどちらですか。
Databricksメダリオンアーキテクチャにおけるシルバー層の主な機能は何ですか?
データエンジニアがDatabricksでデータパイプラインを管理しており、複数のDeltaテーブルがさまざまな変換に使用されています。チームは、Deltaテーブル、ノートブック、ジョブ、ダッシュボード間の依存関係を特定するなど、パイプラインを通じたデータの流れを追跡したいと考えています。データエンジニアはこのプロセスを監視するためにUnity Catalogのリネージ機能を使用しています。Unity Catalogのデータリネージ機能は、Deltaテーブル、ノートブック、ジョブ、ダッシュボード間の関係の可視化をどのようにサポートするのでしょうか?
データ エンジニアには複雑な実行スケジュールを持つジョブがあり、そのスケジュールを他のジョブに転送したいと考えています。
データ エンジニアは、Databricks のスケジュール フォームで各値を手動で選択するのではなく、次のどのツールを使用してプログラムでスケジュールを表し、送信できますか。
データエンジニアが以下のコマンドを使用して新しいデータベースを作成しました。
customer360 データベースが存在しない場合は作成します。
customer360データベースは、以下のどの場所に配置されますか?
データエンジニアは、定期的なメンテナンスが必要なUnityカタログで管理されている複数のDeltaテーブルを扱っています。現在、エンジニアは各テーブルに対してOPTIMIZEジョブとVACUUMジョブを手動でスケジュールし、各テーブルのクエリと更新の頻度に応じて実行頻度を調整しています。
エンジニアは、こうした手作業によるメンテナンスの手間を省き、Databricksがこれらの操作をいつ、どのように実行するかを自動的に判断できるようにする必要がある。
エンジニアはどのような行動をとるべきか?
Databricksのシングルタスクワークフローは、ノートブックのエラーにより最後のタスクで失敗しました。データエンジニアはノートブックのエラーを修正しました。ワークフローを再実行するにはどうすればよいでしょうか?
データエンジニアがUnityカタログ内のサンドボックススキーマを廃止しようとしています。一部のテーブルは一時的なステージング出力であり、完全に削除しても問題ありませんが、いくつかのテーブルはDatabricks外部のダウンストリームジョブで使用される共有クラウドストレージを参照しています。エンジニアはカタログオブジェクトをクリーンアップする際に、共有ファイルを削除しないように注意する必要があります。
Unityカタログは、管理対象テーブルと外部テーブルを削除した場合、どのように動作しますか?
グローバル小売企業は、複数のカテゴリー(例:電子機器、衣料品)と地域(例:北、南、東、西)にわたる製品を販売しています。営業チームは、データエンジニアに以下のような sales_df という名前の PySpark データフレームを提供し、戦略的な意思決定に役立てるために、データエンジニアに販売データの分析を依頼しています。

データエンジニアが、Databricksデータインテリジェンスプラットフォーム上で、ブロンズからシルバーへのパイプラインを設計している。ソースシステムからは毎日CSVファイルが送信され、時間の経過とともに新しいオプション列が追加される。
エンジニアは、以下のすべてを満たすストレージ形式とテーブル機能を必要としています。
定義されたスキーマに準拠しない書き込みは拒否されます。
スキーマは、テーブルを手動で再作成することなく、新しいオプション列を追加するように進化させることができます。
デバッグや監査のために、以前のテーブルバージョンを照会できます。
これらの要件を満たすソリューションはどれですか?
データエンジニアが、運用上の負担を軽減するためにパイプラインタスクを移行しています。ワークスペースはUnity Catalogを使用しており、サーバーレスをサポートするリージョンにあります。エンジニアは、Databricksがインスタンスタイプの自動選択、スケーリングの管理、Photonの適用、およびジョブ実行時のランタイムアップグレードを自動的に処理することを望んでいます。
データエンジニアは、Databricksの制約を遵守しながら、この要件をどのように満たすべきでしょうか?