Databricks Databricks-Certified-Data-Engineer-Professional日本語 試験概要:
| 認定ベンダー: | Databricks |
| 試験名: | Databricks Certified Data Engineer Professional Exam |
| 試験番号: | Databricks-Certified-Data-Engineer-Professional |
| 試験時間: | 120 minutes |
| 受験料: | $200 USD |
| 認定の有効期間: | 2年間 |
| 出題数: | 45-60 |
| 関連資格: | Databricks Certified Data Engineer Associate |
| 合格点: | 70% |
| 対応言語: | 英語 |
| 試験形式: | 選択式(単一選択), 選択式(複数選択), シナリオベースの問題, オンライン監視付き試験 |
| 推奨トレーニング: | Delta Lakeの基本 Databricksデータエンジニアラーニングパス |
| 受験申し込み: | Databricks認定ポータル Databricks Academy |
| サンプル問題: | Databricks Databricks-Certified-Data-Engineer-Professional日本語 サンプル問題 |
| 受験方法: | Databricks認定プラットフォームを介したオンライン監視付き試験 |
| 前提条件: | 推奨:Databricks Certified Data Engineer Associate、またはSparkおよびDelta Lakeに関する同等の実務経験 |
| 公式シラバスのURL: | https://www.databricks.com/learn/certification/data-engineer-professional |
Databricks Databricks-Certified-Data-Engineer-Professional日本語 試験シラバストピック:
| セクション | 目標 |
|---|---|
| トピック 1: データの取り込みと処理 | - Structured Streamingの基本 - ETLパイプラインの設計パターン - Auto Loaderを使用したバッチおよびストリーミングの取り込み |
| トピック 2: Databricks Lakehouseプラットフォームのアーキテクチャ | - メダリオンアーキテクチャ(Bronze、Silver、Gold) - ワークスペースとクラスターのアーキテクチャ - データガバナンスの概念(Unity Catalogの基本) |
| トピック 3: 本番パイプラインとオーケストレーション | - ジョブのスケジューリングと監視 - エラー処理とリカバリ戦略 - Databricks Workflows |
| トピック 4: データモデリングと変換 | - 次元モデリングの概念 - パフォーマンス最適化の手法 - Spark SQLによる変換 |
| トピック 5: Delta Lakeとデータ管理 | - Delta LakeのトランザクションとACID特性 - スキーマの進化と適用 - タイムトラベルとバージョニング |
Databricks Certified Data Engineer Professional Exam (Databricks-Certified-Data-Engineer-Professional日本語版) 認定 Databricks-Certified-Data-Engineer-Professional日本語 試験問題:
1. データエンジニアリングチームのメンバーが、より大規模なデータパイプラインの一部としてスケジュール設定したいという短いノートブックを提出しました。以下のコマンドは、提示されているとおりに実行した場合に論理的に正しい結果を生成するものと仮定します。
ジョブとしてスケジュールする前にノートブックから削除する必要があるコマンドはどれですか?
A) コマンド 5
B) コマンド6
C) コマンド2
D) コマンド3
E) コマンド4
2. Databricksジョブは3つのタスクで構成されており、それぞれがDatabricksノートブックです。タスクAは他のタスクに依存しません。タスクBとCは並列実行され、それぞれがタスクAに対して順次依存関係を持ちます。
スケジュールされた実行中にタスク A が失敗した場合、この実行の結果を説明するステートメントはどれですか。
A) タスク B と C はスキップされます。タスク A で表現された一部のロジックは、タスクが失敗する前にコミットされている可能性があります。
B) すべてのタスクは依存関係グラフとして管理されるため、すべてのタスクが正常に完了するまで、変更は Lakehouse にコミットされません。
C) すべてのタスクが正常に完了しない限り、変更は Lakehouse にコミットされません。タスク A が失敗したため、すべてのコミットは自動的にロールバックされます。
D) タスク B と C は構成どおりに実行しようとします。タスク A で行われた変更は、タスクの失敗によりロールバックされます。
E) タスク B と C はスキップされます。ステージの失敗のため、タスク A は変更をコミットしません。
3. データエンジニアは、Lakeflow Spark Declarative Pipelines で顧客データパイプラインを構築しています。ソースは、顧客レコードの挿入、更新、削除を含む、保存期間が限定されたクラウドベースのイベントストリームです。これらの変更は、SCD タイプ 1 テーブルをターゲットテーブル customer_dim として維持するために、AUTO CDC INTO 構文を使用して適用されます。データエンジニアは、customer_dim テーブルからストリームを取得し、更新イベントと削除イベントのみに反応してデータを増分処理するダウンストリームジョブをどのように構築すればよいでしょうか。
A) SCD 1 として保存する場合、AUTO CDC INTO のターゲットには更新と削除が含まれます。これらの操作により、customer_dim からのストリーミングが失敗する可能性があります。代わりに、元のソースから別のストリームを構築してください。
B) customer_dim テーブルからのストリーミングは、SCD 2 保持の場合にのみ可能です。
C) customer_dim テーブルから変更データ フィードを読み取り、フィルターを適用して変更イベントを段階的に処理します。
D) 更新および削除中にパイプラインが壊れないようにするには、customer_dim からのストリーミング中に ignoreChanges フラグを使用します。
4. 本番環境にデプロイされた構造化ストリーミングジョブにより、クラウドストレージのコストが予想以上に高くなっています。現在、通常の実行では、各マイクロバッチのデータが3秒未満で処理されています。レコード数0のマイクロバッチが1分間に少なくとも12回処理されています。ストリーミング書き込みは、デフォルトのトリガー設定を使用して構成されています。本番環境ジョブは現在、他の多くのDatabricksジョブと共に、インスタンスプールがプロビジョニングされたワークスペースでスケジュールされており、バッチ実行を含むジョブの起動時間を短縮しています。
他のすべての変数を一定に保ち、レコードを 10 分以内に処理する必要があると仮定すると、どの調整が要件を満たすでしょうか。
A) トリガー 1 回オプションを使用し、10 分ごとにクエリを実行するように Databricks ジョブを構成します。このアプローチにより、コンピューティングとストレージの両方のコストが最小限に抑えられます。
B) トリガー間隔を 3 秒に設定します。デフォルトのトリガー間隔では、バッチあたりのレコード消費量が多すぎるため、ディスクへの書き込みが発生し、ボリューム コストが増加する可能性があります。
C) チェックポイント ディレクトリを変更せずにトリガー間隔を変更することはできないため、並列処理を最大化するためにシャッフル パーティションの数を増やします。
D) トリガー間隔を 10 分に設定します。各バッチはソース ストレージ アカウント内の API を呼び出すため、トリガー頻度を最大許容しきい値まで下げると、このコストが最小限に抑えられます。
E) トリガー間隔を 500 ミリ秒に設定します。トリガー間隔を小さく、かつゼロ以外の値に設定すると、ソースが頻繁にクエリされなくなります。
5. データ エンジニアは、ひどく偏った国別の履歴パーティションを持つ Delta テーブルを継承します。
クエリは多くの場合、高カーディナリティの customer_id でフィルタリングされ、時間の経過とともにディメンション間で変化します。エンジニアは、混乱を招く完全な書き換えを回避し、偏ったパーティションの影響を軽減し、アクセスパターンの変化に応じて優れたクエリパフォーマンスを維持する戦略を求めています。データエンジニアが実行すべき2つのアクションはどれですか?(2つ選択してください。)
A) OPTIMIZE table_name を定期的に実行します。
B) 最適化された書き込みのみに依存します。Databricks は時間の経過とともにパーティション分割をクラスタリングに自動的に置き換えます。
C) 静的パーティショニングからリキッド クラスタリングに切り替えて、customer_id などの一般的なフィルターを反映する初期クラスタリング キーを選択します。
D) 既存のパーティションを保持し、ビンパッキング OPTIMIZE のみに依存します。多次元フィルターでは ZORDER とクラスタリングは不要です。
E) メンテナンスのオーバーヘッドを回避するためにデータ スキップ統計を無効にし、代わりに適応型クエリ実行に依存します。
質問と回答:
| 質問 # 1 正解: B | 質問 # 2 正解: A | 質問 # 3 正解: C | 質問 # 4 正解: D | 質問 # 5 正解: A、C |














1039 お客様のコメント
品質保証JPexamはIT認定試験のシラバスに従って、試験問題の範囲を正確に絞って、的中率が99%の最新問題集を捧げます。
1年間の無料更新サービスJPexamは1年以内に問題集の無料更新サービスを提供し、お客様がいつでも最新版の問題集を持つことを保証いたします。もし試験の内容が変更されたら、弊社は直ちにお客様にお知らせします。それに、弊社の問題集が更新されたら、早速メールで最新バージョンを送付いたします。
全額返金JPexamの問題集を利用すると、短時間で勉強しても試験に合格できるのを保証いたします。試験に不合格になってしまった場合、弊社は全額返金いたします。(
ご購入前のお試しJPexamは問題集のサンプルを無料で提供いたします。ご購入前にサンプルを試用して製品の品質を確認することができます。ご遠慮なく利用してください。
