在 pyspark 中对数据帧应用逻辑运算

Question

John Stud

Asked: 2023-09-19 22:14:57 +0800 CST2023-09-19 22:14:57 +0800 CST 2023-09-19 22:14:57 +0800 CST

Databricks Autoloader / writeStream：如何重试？

772

我正在尝试将 AutoLoader 与 Databricks 一起使用，但我遇到了以下建议和错误：

org.apache.spark.sql.catalyst.util.UnknownFieldException: 
[UNKNOWN_FIELD_EXCEPTION.NEW_FIELDS_IN_FILE] 
Encountered unknown fields during parsing: [col_name_here], 
which can be fixed by an automatic retry: true

我无法使用 Google 找到捕获任何此错误语言的单个文档，因此我不确定如何以及在何处可以使用此假定的修复。

我的代码如下：

xd = spark.readStream.format("cloudFiles") \
  .option("cloudFiles.format", "csv") \
  .option("cloudFiles.schemaLocation", "dbfs:/mnt/temp/checkpoints/schema") \
  .option("cloudFiles.schemaEvolutionMode","addNewColumns") \
  .option("pathGlobfilter", "20230808_*") \
  .load("/mnt/test_loc") \
.writeStream \
.format("delta") \
.outputMode("append") \
.option("checkpointLocation", "dbfs:/mnt/temp/checkpoints") \
.option("mergeSchema", "true") \
.option("overwriteSchema", "true") \
.toTable("dBronze.Table1")

1 个回答

Voted

Alex Ott · Answer 1 · 2023-09-19T23:13:14+08:00

Best Answer

Alex Ott

2023-09-19T23:13:14+08:002023-09-19T23:13:14+08:00

您只需要再次重新运行代码，它就会拾取架构中的更改。如果它是自动化作业，您可以在作业级别配置重试（请参阅文档）。

PS 您可以尝试查看Delta Live Tables - 它会自动重试此类任务。

1

Databricks Autoloader / writeStream：如何重试？

使用 <font color="#xxx"> 突出显示 html 中的代码

为什么在传递 {} 时重载解析更喜欢 std::nullptr_t 而不是类？

您可以使用花括号初始化列表作为（默认）模板参数吗？

为什么列表推导式在内部创建一个函数？

我正在尝试仅使用海龟随机和数学模块来制作吃豆人游戏

java.lang.NoSuchMethodError: 'void org.openqa.selenium.remote.http.ClientConfig.<init>(java.net.URI, java.time.Duration, java.time.Duratio

为什么 'char -> int' 是提升，而 'char -> Short' 是转换（但不是提升）？

为什么库中不调用全局变量的构造函数？

std::common_reference_with 在元组上的行为不一致。哪个是对的？

C++17 中 std::byte 只能按位运算？

Databricks Autoloader / writeStream：如何重试？

1 个回答

相关问题