跳转到主要内容
JDBC 是 Spark 中最常用的数据源之一。 本节将详细介绍如何 在 Spark 中使用 ClickHouse 官方 JDBC 连接器

读取数据

写入数据

并行度

使用 Spark JDBC 时,Spark 默认只使用单个分区读取数据。要实现更高的并发度,必须指定 partitionColumnlowerBoundupperBoundnumPartitions,这些参数用于定义 多个工作线程并行读取时如何对表进行分区。 更多信息请参阅 Apache Spark 官方文档中的 JDBC 配置

JDBC 限制

  • 由于缺少 ClickHouse 方言,Spark JDBC 不支持复杂类型 (MAP、ARRAY、STRUCT) ——如需完整支持复杂类型,请使用原生 Spark-ClickHouse 连接器。
  • 目前,你只能通过 JDBC 将数据插入现有表中 (当前还无法像 Spark 对其他连接器那样,在插入 DF 时自动创建 表) 。
最后修改于 2026年7月2日