Databricks Certified Data Engineer Associate Exam (Databricks-Certified-Data-Engineer-Associate日本語版) (Databricks-Certified-Data-Engineer-Associate日本語) Free Practice Test
Question 1
あるデータエンジニアは、複数のソースからのストリーミングデータとバッチデータの両方を処理するETLパイプラインを設計しています。このパイプラインは、データ品質の確保、スキーマの進化への対応、そして容易なメンテナンスを実現する必要があります。チームはこれらの目標を達成するために、DatabricksのDelta Live Tables(DLT)の活用を検討しています。彼らは、このユースケースに適したDLTの主な機能とメリットを理解したいと考えています。
Delta Live Tables (DLT) が適切な選択である理由は何ですか?
Delta Live Tables (DLT) が適切な選択である理由は何ですか?
Correct Answer: D
Explanation: Only visible for TestSimulate members. You can sign-up / login (it's free).
Question 2
データエンジニアは、セッション中にデータセットが変更されないにもかかわらず、Sparkジョブが大きなDeltaテーブルを繰り返しスキャンしていることに気づきました。繰り返し実行されるクエリを高速化するために、データセットをメモリに格納できる手法はどれでしょうか?
Correct Answer: D
Question 3
開発者は、ブロンズテーブルのレコードをシルバーテーブルに処理するデータパイプラインを構築しています。ブロンズテーブル(bronze_events)には、上流のデータ取り込みシステムからの少なくとも1回の配信保証により、重複レコードが含まれています。開発者は、データを準備するために次のPySparkコードを記述します。

開発者は、引数なしで dropDuplicates() を実行した後、event_timestamp 列のみが異なる行が残っていることに気づきました。開発者は、user_id と event_type のみに基づいて重複を削除し、これら 2 つの列の一意の組み合わせごとに 1 つの行を残したいと考えています。
どのコード変更によって、この重複排除の要件が満たされますか?

開発者は、引数なしで dropDuplicates() を実行した後、event_timestamp 列のみが異なる行が残っていることに気づきました。開発者は、user_id と event_type のみに基づいて重複を削除し、これら 2 つの列の一意の組み合わせごとに 1 つの行を残したいと考えています。
どのコード変更によって、この重複排除の要件が満たされますか?
Correct Answer: D
Explanation: Only visible for TestSimulate members. You can sign-up / login (it's free).
Question 4
データアーキテクトは、以下の形式のテーブルが必要であると判断しました。

次のコードブロックのうち、既に同じ名前のテーブルが存在するかどうかに関わらず、上記の形式で空のデルタテーブルを作成するためにSQL DDLコマンドを使用するものはどれですか?

次のコードブロックのうち、既に同じ名前のテーブルが存在するかどうかに関わらず、上記の形式で空のデルタテーブルを作成するためにSQL DDLコマンドを使用するものはどれですか?
Correct Answer: B
Question 5
Databricksのシングルタスクワークフローがノートブック内のエラーにより失敗しました。データエンジニアがノートブック内のエラーを修正しました。
データエンジニアはワークフローを再実行するために何をすべきでしょうか?
データエンジニアはワークフローを再実行するために何をすべきでしょうか?
Correct Answer: D
Explanation: Only visible for TestSimulate members. You can sign-up / login (it's free).
Question 6
データ エンジニアは、Databricks SQL ダッシュボードを 1 日に 1 回更新するようにスケジュール設定したいと考えていますが、関連付けられている SQL エンドポイントは必要なときにのみ実行したいと考えています。
データ エンジニアがダッシュボードの更新スケジュールで使用される SQL エンドポイントの合計実行時間を最小限に抑えるために使用できるアプローチは次のどれですか。
データ エンジニアがダッシュボードの更新スケジュールで使用される SQL エンドポイントの合計実行時間を最小限に抑えるために使用できるアプローチは次のどれですか。
Correct Answer: C
Question 7
オートローダーがデータを段階的に処理する際に使用するツールは次のどれですか?
Correct Answer: C
Question 8
あるチームが、デプロイメント用のDatabricksアセットバンドルを設計しています。彼らは、バンドルに必要なすべてのリソース、対象環境の設定、およびデプロイメント設定が、単一のバージョン管理されたファイルに含まれていることを確認したいと考えています。プロジェクトのルートにあるメイン設定ファイルとして必要なものは何でしょうか?
Correct Answer: D
Explanation: Only visible for TestSimulate members. You can sign-up / login (it's free).
Question 9
ブロンズ層を構築する際に、通常どのような加工工程が含まれますか?
Correct Answer: C
Explanation: Only visible for TestSimulate members. You can sign-up / login (it's free).
Question 10
データエンジニアは、Deltaテーブルに関連付けられたデータファイルが非常に小さいことに気づきました。パフォーマンスを向上させるため、小さなファイルを圧縮して大きなファイルにしたいと考えています。
小さなファイルを圧縮するために使用できるキーワードは次のどれですか?
小さなファイルを圧縮するために使用できるキーワードは次のどれですか?
Correct Answer: A
Question 11
データエンジニアは、タスクAが成功し、かつタスクBが失敗した場合にのみタスクCを実行する必要がある。この条件付きロジックを実装する依存関係構成はどれか?
Correct Answer: A
Explanation: Only visible for TestSimulate members. You can sign-up / login (it's free).
Question 12
データエンジニアリングチームは、毎日複数のバッチジョブを実行しています。チームは、安定したパフォーマンスと制御されたリソース使用量で、固定された夜間スケジュールでジョブを実行する必要があります。チームは、運用上のオーバーヘッドを最小限に抑え、アイドル状態のクラスタコストを削減したいと考えています。チームはどのコンピューティングオプションを使用すべきでしょうか?
Correct Answer: A
Explanation: Only visible for TestSimulate members. You can sign-up / login (it's free).
Question 13
データエンジニアは、Delta Live Tables(DLT)パイプラインに3つのテーブルを配置しています。各テーブルで無効なレコードを削除するようにパイプラインを設定しています。DLTパイプラインのどこかの時点で、品質上の懸念から一部のデータが削除されていることに気付きました。パイプラインのどのテーブルでデータが削除されているのかを特定したいと考えています。
データ エンジニアがレコードを削除しているテーブルを識別するために実行できるアプローチは次のどれですか。
データ エンジニアがレコードを削除しているテーブルを識別するために実行できるアプローチは次のどれですか。
Correct Answer: A
Question 14
データエンジニアがSpark SQLを使用して、Delta形式で保存された大規模なデータセットを分析しています。エンジニアは、パーティション列でフィルタリングするクエリの実行速度が著しく速いことに気づきました。このパフォーマンス向上の主な理由は何でしょうか?
Correct Answer: C