pg_parquet
在PostgreSQL与本地/S3中的Parquet文件复制数据
仓库
CrunchyData/pg_parquet
https://github.com/CrunchyData/pg_parquet/
源码
pg_parquet-0.5.1.tar.gz
pg_parquet-0.5.1.tar.gz
概览
| 扩展包名 | 版本 | 分类 | 许可证 | 语言 |
|---|---|---|---|---|
pg_parquet | 0.5.1 | OLAP | PostgreSQL | Rust |
| ID | 扩展名 | Bin | Lib | Load | Create | Trust | Reloc | 模式 |
|---|---|---|---|---|---|---|---|---|
| 2480 | pg_parquet | 否 | 是 | 是 | 是 | 否 | 否 | - |
| 相关扩展 | file_fdw aws_s3 pg_bulkload pg_lake pg_ducklake pg_duckdb pg_mooncake pg_fact_loader pg_csv omni_csv |
|---|
版本
| 类型 | 仓库 | 版本 | PG 大版本 | 包名 | 依赖 |
|---|---|---|---|---|---|
| EXT | PIGSTY | 0.5.1 | 1817161514 | pg_parquet | - |
| RPM | PIGSTY | 0.5.1 | 1817161514 | pg_parquet_$v | - |
| DEB | PIGSTY | 0.5.1 | 1817161514 | postgresql-$v-pg-parquet | - |
构建
您可以使用 pig build 命令构建 pg_parquet 扩展的 RPM / DEB 包:
BASH
安装
您可以直接安装 pg_parquet 扩展包的预置二进制包,首先确保 PGDG 和 PIGSTY 仓库已经添加并启用:
BASH
使用 pig 或者是 apt/yum/dnf 安装扩展:
安装
BASH
pig
BASH
dnf
BASH
apt
BASH
预加载配置:
BASH
创建扩展:
SQL
用法
pg_parquet 主要提供以下三项功能:
- 将 PostgreSQL 表/查询结果导出为 Parquet 文件,
- 将 Parquet 文件中的数据导入到 PostgreSQL 表中,
- 查看 Parquet 文件的模式与元数据信息。
使用 COPY 在 Parquet 文件与 PostgreSQL 表之间导入导出
可以使用 PostgreSQL 的 COPY 命令来读写 Parquet 文件。以下示例演示了如何将包含复合类型的 PostgreSQL 表写入 Parquet 文件,然后再将该 Parquet 文件的内容读回同一张表。
SQL
此外,也可以使用 COPY 命令通过标准输入/输出读写 Parquet 流。以下是使用示例(必须指定 format = parquet):
BASH
查看 Parquet 文件模式
调用 SELECT * FROM parquet.schema(<uri>) 可查看指定 URI 处 Parquet 文件的模式信息。
SQL
查看 Parquet 元数据
调用 SELECT * FROM parquet.metadata(<uri>) 可查看指定 URI 处 Parquet 文件的详细元数据,例如列统计信息等。
SQL
SQL
调用 SELECT * FROM parquet.file_metadata(<uri>) 可查看指定 URI 处 Parquet 文件的文件级元数据,例如格式版本等。
SQL
调用 SELECT * FROM parquet.kv_metadata(<uri>) 可查询指定 URI 处 Parquet 文件的自定义键值元数据。
SQL
查看 Parquet 列统计信息
调用 SELECT * FROM parquet.column_stats(<uri>) 可查看指定 URI 处 Parquet 文件的列统计信息,例如列的最小值和最大值等。
SQL