Apache Beam 2.25.0 发布，大数据流处理与批处理编程范式

Apache Beam 2.25.0 发布了。Beam 是一个用于定义和执行数据处理管道的统一编程模型，包括 ETL、批处理与流处理。Beam 项目重点在于数据处理的编程范式和接口定义，并不涉及具体执行引擎的实现，理想情况是基于 Beam 开发的数据处理程序可以执行在任意的分布式计算引擎上。

此版本主要特性变更包括：

在 ReadFromBigQuery 的 JSON 解码器中增加了对可重复字段的支持。（Python）
为 Python SDK 添加了一个 opt-in、performance-driven 的运行时类型检查系统。
添加了对使用 typed PCollections 的 PTransforms 上的 Python 3 类型注释的支持。
改进了 Interactive Beam API，streaming jobs 现在可以启动长时间运行的后台录制作业。从 recording 中运行 ib.show() 或 ib.collect() samples。
在 Interactive Beam 中，ib.show() 和 ib.collect() 现在具有“n”和“duration”作为参数。这些意味着最多只能读取“ n”个元素，并且最多只能从 recording 中读取“duration”秒的数据。
Dataframes 支持的初步预览。
修复了 Python SDK 中对 @ptransform_fn 装饰符的类型提示支持。默认情况下未启用此功能以保持向后兼容性；可使用 --type_check_additional=ptransform_fn标志启用。在以后的 Beam 版本中，可能会默认启用它。
添加了 X feature（Java/Python）。

注意：本文归作者所有，未经作者允许，不得转载