Skip to main content

Descripción

Apache ORC es un formato de almacenamiento columnar ampliamente utilizado en el ecosistema de Hadoop.

Correspondencia de tipos de datos

La siguiente tabla compara los tipos de datos ORC compatibles y sus correspondientes tipos de datos de ClickHouse en las consultas INSERT y SELECT.
  • Los demás tipos no son compatibles.
  • Una columna ORC Union se lee como un Variant con los tipos de rama de la unión, y una columna Variant se escribe como una Union de ORC con sus tipos de rama. Tenga en cuenta que Variant ordena sus tipos de rama, por lo que el orden de las ramas puede diferir del archivo ORC. Las uniones con tipos de rama duplicados (p. ej., uniontype<int,int>) no son compatibles.
  • Los arrays pueden anidarse y pueden tener un valor de tipo Nullable como argumento. Los tipos Tuple y Map también pueden anidarse.
  • Los tipos de datos de las columnas de una tabla de ClickHouse no tienen por qué coincidir con los campos de datos ORC correspondientes. Al insertar datos, ClickHouse interpreta los tipos de datos según la tabla anterior y luego convierte los datos al tipo de dato definido para la columna de la tabla de ClickHouse.

Ejemplo de uso

Inserción de datos

Usa un archivo ORC con los siguientes datos, llamado football.orc:
Inserte los datos:

Lectura de datos

Lea los datos en formato ORC:
ORC es un formato binario que no puede mostrarse en la terminal de forma legible para humanos. Use INTO OUTFILE para generar archivos ORC.

Configuración de formatos

Para intercambiar datos con Hadoop, puede usar el motor de tablas HDFS.
Última modificación el 14 de agosto de 2026