متطلبات مسار المعالجة
- يجب أن يكون جدول BigQuery المصدر موجودًا.
- يجب أن يكون جدول ClickHouse الهدف موجودًا.
- يجب أن يكون مضيف ClickHouse متاحًا من الأجهزة العاملة في Dataflow.
معلمات القالب
يمكن الاطلاع على القيم الافتراضية لجميع معلمات
ClickHouseIO في موصل Apache Beam لـ ClickHouseIOمخطط جدولَي المصدر والهدف
- تنشئ القوالب كائن مخطط استنادًا إلى جدول ClickHouse الهدف.
- تمرّ القوالب على مجموعة بيانات BigQuery وتحاول مطابقة الأعمدة بناءً على أسمائها.
مطابقة أنواع البيانات
تشغيل قالب
احرص على مراجعة هذا المستند، ولا سيما الأقسام الواردة أعلاه، لفهم متطلبات تهيئة قالب والمتطلبات المسبقة الخاصة به فهمًا كاملًا.
- Google Cloud Console
- Google Cloud CLI
سجّل الدخول إلى Google Cloud Console وابحث عن DataFlow.
- اضغط على الزر
CREATE JOB FROM TEMPLATE - بعد فتح نموذج قالب، أدخل اسم المهمة وحدد المنطقة المطلوبة.
- في حقل
DataFlow Template، اكتبClickHouseأوBigQuery، ثم اختر قالب BigQuery to ClickHouse - بعد الاختيار، سيتوسع النموذج ليتيح لك إدخال تفاصيل إضافية:
- عنوان JDBC URL لخادم ClickHouse، بالتنسيق التالي
jdbc:clickhouse://host:port/schema. - اسم مستخدم ClickHouse.
- اسم الجدول الهدف في ClickHouse.
- عنوان JDBC URL لخادم ClickHouse، بالتنسيق التالي
خيار كلمة مرور ClickHouse مُشار إليه على أنه اختياري، وذلك لحالات الاستخدام التي لا تكون فيها كلمة مرور مُعدّة.
لإضافتها، يُرجى التمرير إلى أسفل حتى خيار
Password for ClickHouse Endpoint.- خصّص وأضف أي إعدادات مرتبطة بـ BigQuery/ClickHouseIO، كما هو موضح في قسم معلمات القالب
مراقبة المهمة
استكشاف الأخطاء وإصلاحها
خطأ تجاوز الحد الإجمالي للذاكرة (الرمز 241)
- زيادة موارد المثيل: قم بترقية خادم ClickHouse إلى مثيل أكبر مزود بذاكرة أكبر للتعامل مع حمل معالجة البيانات.
- تقليل حجم الدفعة: عدّل حجم الدفعة في إعدادات مهمة Dataflow لإرسال أجزاء أصغر من البيانات إلى ClickHouse، مما يقلل استهلاك الذاكرة لكل دفعة. يمكن أن تساعد هذه التغييرات في تحقيق توازن في استخدام الموارد أثناء إدخال البيانات.
الشيفرة المصدرية للقالب
GoogleCloudPlatform/DataflowTemplates— المستودع الأصلي على Google Cloud Platform.ClickHouse/DataflowTemplates— النسخة المتفرعة الخاصة بـ ClickHouse.