Sin reclamar: ¿Estás trabajando en Hive?
Hive Reseñas: 4.2/5 — Una buena elección
Hive es una herramienta de gestión de proyectos todo en uno desarrollada para "ayudar a los equipos a avanzar más rápido", independientemente de cómo trabajen. Las funciones se crean en función de las solicitudes de los usuarios y se actualizan semanalmente, lo que convierte a Hive en la primera plataforma de software democrática del mundo. Es mejor conocido por sus capacidades en gestión de proyectos, gestión del tiempo, colaboración en equipo, automatización y una variedad de integraciones con software de terceros. Hive es de uso gratuito para usuarios individuales y con versiones premium disponibles para equipos y empresas.
| Capacidades |
API
|
|---|---|
| Segmento |
Pequeña Empresa
Mercado medio
Empresa
|
| Despliegue | Nube / SaaS / Basado en web, Android móvil, iPad móvil, iPhone móvil |
| Soporte | 24 horas al día, 7 días a la semana (representante en vivo), chat, correo electrónico/servicio de ayuda, preguntas frecuentes/foro, base de conocimientos, soporte telefónico |
| Capacitación Especializada | Documentación |
| Idiomas | Inglés |
Compara Hive con otras herramientas populares de la misma categoría.
Aproveche las habilidades de SQL para realizar operaciones en datos almacenados en Hadoop.
Funciona con el algoritmo de reducción de mapas, por lo que la recuperación de datos es un poco lenta.
Permitió a los usuarios comerciales consultar datos utilizando habilidades SQL.
Lo mejor de HIVE es que cualquiera que esté familiarizado con SQL puede aprovechar su capacidad para ejecutar trabajos de map-reduce. Las versiones más recientes de HIVE están mejorando la compatibilidad con funciones de ventanas y la corrección de inconsistencias. Hasta ahora, la documentación es suficiente para facilitarme las tareas y el soporte para este producto sigue vigente, lo cual me parece una muy buena señal.
Las versiones antiguas de HIVE son deficientes. Presentan numerosas limitaciones que te obligan a escribir consultas HiveQL complejas e incluso potencialmente ineficientes. Por ejemplo, la falta de compatibilidad con funciones de ventana y la ausencia de comparaciones de igualdad en las uniones pueden complicarte la vida, por lo que tendrás que recurrir a uniones completas o autouniones complejas para lograr la misma tarea.
Utilizamos HIVE como almacén de datos. Una de sus ventajas es que permite dividir las consultas SQL en una serie de trabajos de map-reduce, por lo que se supone que acelera las consultas si se le asignan suficientes nodos de cómputo.
Hive es la mejor opción para responder consultas ad-hoc en un paradigma paralelo. Funciona muy bien con el sistema Hadoop Echo (se integra perfectamente con HDFS). Es fácil de usar, ya que implementa la mayoría de las funciones SQL.
- Se necesita mayor optimización para consultas complejas (como almacenamiento en caché, particionamiento automático, etc.) para reducir la latencia de las consultas. - Ajustar los parámetros de Hive es un gran desafío para los usuarios. La configuración predeterminada no funciona con consultas grandes. - Hive es ideal si el 90-95 % de las consultas son de solo lectura. No es adecuado para aplicaciones con actualizaciones frecuentes.
Obtenga información rápida del big data en caso de que los datos de los clientes no quepan en una sola máquina. Esto facilita enormemente la preparación de datos (es decir, la creación de tablas temporales), que pueden ser utilizadas por otras soluciones de aprendizaje automático como Spark para crear modelos que aporten mayor valor comercial.
A pesar de toda su potencia de procesamiento, Pig requiere que los programadores aprendan algo más que SQL. Requiere aprender y dominar algo nuevo. Las sentencias de Hive son notablemente similares a SQL y, a pesar de las limitaciones del lenguaje de consulta de Hive (HQL) en cuanto a los comandos que entiende, sigue siendo muy útil. Hive ofrece una excelente implementación de código abierto de MapReduce. Funciona bien al procesar datos almacenados de forma distribuida, a diferencia de SQL, que requiere un estricto cumplimiento de esquemas al almacenar datos.
A pesar de las diferencias de trabajo, una vez que ingresa al mundo Hive desde SQL, la similitud en el lenguaje garantiza una transición sin problemas, pero es importante tener en cuenta las diferencias en las construcciones y la sintaxis; de lo contrario, se enfrentará a momentos frustrantes.
Extracción, procesamiento y análisis de datos. Es rápido.
Hive facilita el almacenamiento de datos masivos en formato tabular. Funciona con las mismas consultas que SQL, lo que facilita el uso de bases de datos tradicionales. Por ello, no es necesario aprender un nuevo lenguaje y se puede adaptar a la cultura del big data. Además, cuenta con funciones como partición y agrupación en cubos, que facilitan la segregación de datos. Los datos se pueden cargar directamente en Hive mediante HDFS, utilizando archivos CSV del mismo formato, o desde Hbase, creando un puntero a la tabla de Hbase y creando un enlace dentro de Hadoop.
Para cantidades pequeñas de datos, también ejecuta la tarea map reduce, lo cual consume tiempo y, por lo tanto, no es eficiente. En Hive, no existe el concepto de clave principal, por lo que pueden existir entradas redundantes. Además, hasta la versión anterior, no era posible actualizar ni eliminar, y ahora, incluso en la nueva versión, si se usan estos comandos, el rendimiento de la herramienta se ve afectado.
Utilizamos Hive para almacenar registros de los datos generados en nuestra empresa. Además, utilizaremos estos registros para la conciliación, lo que nos ayudará a mantener un registro de los datos.
Producto estable; Fácil de usar; Múltiples motores de cálculo: Tez, MR; Casi todas las capacidades de SQL;
El soporte para eliminar aún no está disponible, aunque casi está listo.
Motor de consulta principal para análisis de datos
Proporciona resultados rápidos basados en una base de datos Hadoop, interfaz fácil de usar con pasos de configuración simples.
Algunas peculiaridades de HiveQL pueden requerir consultar la documentación, pero hay mucha similitud con otros lenguajes basados en SQL.
Análisis de datos, que permite que grandes cantidades de datos estén disponibles para usos generales de BI
Hive está diseñado para simplificar su experiencia con Hadoop y permite a los desarrolladores y analistas de negocios aplicar sus conocimientos de SQL para consultar datos, crear informes, crear etl, etc.
Al ser software de código abierto, presenta problemas comunes de soporte. Además, Hive no admite muchas funciones que sí ofrece el SQL tradicional.
El propósito principal de Hive es generar informes y analizar los datos almacenados en el sistema de archivos Hadoop. Actualmente, es el único framework compatible con las herramientas de inteligencia empresarial más populares para leer datos del sistema HDFS.
Facilidad de uso y escalabilidad. Ha demostrado su fiabilidad. Han seguido añadiendo nuevas funciones y, al mismo tiempo, han aumentado su velocidad.
La velocidad sigue siendo menor en comparación con los almacenes distribuidos más recientes. Además, todavía utiliza MapReduce en segundo plano, lo cual es muy lento actualmente.
Almacenar grandes cantidades de datos que no caben en ningún sistema de bases de datos relacionales. Obtener información valiosa de nuestros datos ejecutando trabajos de MapReduce en los datos almacenados en Hive.
Lo mejor de Hive es que es fácil de dominar gracias a su interfaz similar a SQL. Además, es una herramienta muy útil para funciones ETL y DW.
No se me da muy bien configurar parámetros de optimización. Hay que recordar muchas configuraciones de la consola. El índice no resulta muy útil. Las funciones CRUD tienen muchos prerrequisitos, como que la tabla esté agrupada, etc.
Estamos intentando crear una herramienta de canalización ETL estándar que admita utilidades de BI/informes estándar.
La mejor parte es poder utilizar una sintaxis familiar.
No es compatible con todos los casos de uso de MYSQL (es comprensible).
Consultas ad-hoc sobre datos de producción ETL.
Poder ejecutar trabajos de reducción de mapas utilizando el análisis json y generar particiones dinámicas en formato de archivo parquet.
Es lento en comparación con Spark/Impala para la mayoría de las operaciones. Además, genera un error de memoria insuficiente si se actualizan varias particiones que contienen muchos archivos parquet.
Los eventos se recopilan en HDFS mediante Flume y deben procesarse en archivos Parquet para una consulta rápida. Los datos de entrada contienen atributos variables en la carga útil JSON, ya que cada cliente puede definir atributos personalizados. Esto forma parte de la canalización ETL, donde los trabajos de Hive leen datos JSON y generan archivos Parquet que se consultarán mediante Impala/Spark. Mediante vistas, cada cliente consulta solo los datos relevantes.
Los mejores beneficios son realizar consultas similares a SQL, particionar tablas, desnormalizar datos y comprimir la salida de mapa/reducir.
En algunos casos no es posible realizar operaciones complicadas usando Hive, por ejemplo, cuando la salida de un trabajo actúa como entrada para otro trabajo (archivo SequenceFileFormat) o se escribe una consulta en un archivo de imagen; Hive no es útil.
Hive ayuda a resolver problemas de big data
Hadoop no tiene un lenguaje de consulta nativo, pero Hive es una excelente opción para usar sobre Hadoop. Podría apuntar los datos almacenados en Hadoop a una tabla específica y usar consultas normales como suelo hacer en SQL. Podemos unir y realizar agregaciones, etc. Simplifica mucho las cosas.
Puede ser muy lento, ya que se ejecuta en tareas de reducción de mapas subyacentes. Los datos no se pueden actualizar, pero tendremos que reescribirlos.
Para las personas que están acostumbradas a escribir consultas SQL, sería muy útil utilizar Hive sobre Hadoop para los archivos almacenados en HDFS.
-> Fácil de configurar/crear una tabla para Big Data o datos en streaming -> Consultas rápidas y sencillas. Tanto profesionales como personas sin conocimientos técnicos pueden usar HUE para consultas más interactivas en tablas de Hive -> HUE permite guardar resultados y consultas antiguas, además de exportarlos en Excel.CSV
-> Unir y analizar varias tablas con tamaños enormes sigue siendo un desafío. -> Algunas operaciones de SQL no funcionan en Hive, como las uniones sin igualdad,
Actividad del vertedero Transmisión de datos de Big Data, así como registros de datos en Hive
El marco de código abierto permite leer, escribir y administrar datos como SQL, HQl, lo que lo hace fácil de usar.
La latencia en Apache Hive es muy alta.
Proporciona un lenguaje de consulta similar a SQL llamado HQl con esquema en lectura y convierte de manera transparente las consultas en mapas y reducciones.
Lo que más me gusta de Apache Hive es su compatibilidad con particiones y buckets para una rápida recuperación de datos. Podemos crear UDF personalizadas según las necesidades para limpiar y filtrar datos. Es compatible con HQL, similar a SQL, lo que facilita la tarea a quienes tienen conocimientos de SQL.
No es compatible con OLTP y tampoco admite acciones de eliminación o actualización.
Hemos creado una capa semántica en Hive que nos ayuda a procesar los terabytes de datos y generar los informes más rápido. También nos ayudó a la tolerancia a fallos y la alta disponibilidad de los datos.
Flexible y fácil de entender me encantó.
No es compatible con múltiples plataformas, por lo que depende principalmente de la forma de la trama.
Funciona mejor con trabajos o tareas relacionadas con ETL
Es fácil ejecutar consultas en Hive, ya que usa HQL, que es muy similar a SQL. Hive cuenta con el servicio hivemetastore para guardar los metadatos y con hiveserver2 para atender las solicitudes de los clientes. Esta segregación facilita la correcta distribución de recursos. Hive también es tolerante a fallos, lo que lo hace ideal para ejecutar lotes ETL de larga duración.
Hive tiene un problema de inicio en frío y dado que usa el algoritmo mapreduce en el backend, es mucho más lento que spark, lo que nos hizo pasar de hive a spark, ya que el tiempo de finalización del trabajo después de cambiar a spark se redujo en un 70-80%.
Ingesta de datos de Informatica Ingesta y modificaciones de datos de Abinitio Formato de datos (ya que proporciona opciones como csv, parauet, etc.) Transformación de datos mediante consultas de Hive Canalizaciones de datos
La facilidad de uso de la herramienta de almacenamiento de datos para los desarrolladores de bases de datos
No incluye propiedades ácidas, no tiene las propiedades ácidas como en las bases de datos
Normalmente uso Hive para mis big data [problemas de migración de datos], la velocidad a la que opera la consulta y la opción de elegir varios motores.
Si eres analista de datos y experto en SQL, usa Hive. Es muy fácil trabajar con Hive, especialmente si te gusta SQL. En el trabajo, utilizo Hive y Pig. Utilizo Hive principalmente para consultas e informes puntuales. Para informes de BI, Hive es la mejor opción, ya que permite reutilizar todo el SQL que se ha generado para almacenes de datos tradicionales. Además, con Hive Server2, obtienes compatibilidad real con JDBC para conectar tus herramientas de BI. Se están añadiendo a Hive muchas más funciones de SQL, como cubos, rollups, ventanas, retardo, adelanto, etc., gracias a la iniciativa Hortonworks Stinger. Hive también produce código muy compacto, lo que siempre es útil para la lectura y la depuración.
Sugeriría usar Hive para proyectos grandes, donde desea implementar acceso a datos tipo SQL, esquemas, metadatos, particiones, implementación basada en servidor, jdbc, etc. Pig es un buen lenguaje y puede ser muy útil para tareas inmediatas o proyectos pequeños. Recomendaría PIG para proyectos pequeños.
Hive Hadoop ofrece a los usuarios funciones estadísticas potentes y robustas. Hive Hadoop es similar a SQL, por lo que para cualquier desarrollador de SQL la curva de aprendizaje de Hive será prácticamente nula. Hive Hadoop se puede integrar con HBase para consultar datos en HBase, a diferencia de Pig. En el caso de Pig, se utiliza la función HbaseStorage() para cargar los datos desde HBase. Hive Hadoop ha ganado popularidad gracias al soporte de Hue. Hive Hadoop cuenta con diversos grupos de usuarios, como CNET, Facebook, Digg, etc.
Si sabe cómo escribir sentencias SQL, puede escribir hiveql y no es necesario que aprenda nada nuevo, es bastante sencillo.
El ajuste del rendimiento es difícil y se vuelve difícil para consultas complejas, todavía tiene algunos errores como que todos los datos van a un solo reductor, lo que puede provocar que los resultados de la consulta se ralenticen.
Para desarrollar informes para analistas de negocios, muchos de ellos conocen sentencias SQL, por lo que es fácil escribir y extraer información para su análisis.
- Fácil de aprender - Puede consultar datos complejos, incluidas estructuras anidadas. - Flexible (con respecto al esquema de datos) - Con ORC SerDe, la E/S se puede reducir drásticamente, leyendo solo lo que se requiere (formatos columnares).
- Necesita que el esquema se defina previamente. - No es compatible con ANSI SQL. - No es adecuado para consultas interactivas rápidas, incluso en conjuntos de datos de tamaño moderado. - Funciona solo con Hadoop (no es una herramienta de procesamiento de consultas independiente). - No es de nivel empresarial en cuanto a calidad de la documentación y mensajes de error.sages, apoyo
Explorando formas de almacenar y procesar conjuntos de datos semánticos
Hive puede decirnos el progreso detallado de una consulta y puede incorporar UDF en diferentes idiomas.
La velocidad de la consulta es demasiado lenta y no admite argumentos posicionales en GROUP BY y ORDER BY
Usamos Hive para ejecutar nuestros flujos de trabajo nocturnos en HDFS en lotes para la agregación y análisis de datos.
La sintaxis de Hive es prácticamente idéntica a la de SQL, por lo que para alguien familiarizado con SQL, aprender a usar Hive es prácticamente intuitivo. Permite realizar una amplia variedad de análisis sobre grandes conjuntos de datos y requiere muy pocos ajustes si se está dispuesto a esperar un tiempo para obtener los resultados.
Hive puede ser un poco lento en comparación con otros lenguajes como Pig. Además, no cuenta con un lenguaje de scripting tan completo. Esto lo convierte en la segunda opción para la mayoría de los trabajos de análisis de datos en LinkedIn.
Intentamos extraer datos de conjuntos masivos de datos para diversos fines (depurar problemas de producción, crear métricas de negocio, modelos y pronósticos, entre otros). Lo hemos logrado con gran facilidad gracias a nuestro almacén de datos y una combinación de Hive y Pig.
Hive es una infraestructura de almacenamiento de datos basada en Hadoop que permite la agrupación, consulta y análisis de datos. Apache Hive admite el análisis de grandes conjuntos de datos almacenados bajo HDFS de Hadoop y en sistemas compatibles como el sistema de archivos de Amazon. Ofrece un lenguaje de consulta basado en SQL llamado HiveQL5 con esquemas para leer y convertir consultas de forma transparente en tareas de MapReduce, Apache Tez6 y Spark. Los tres motores de ejecución pueden ejecutarse en YARN. Para acelerar las consultas, Hive proporciona índices, incluidos los de mapa de bits.
Ofrece muchas herramientas, tiene gran potencial de crecimiento.
Posibilidad de almacenar metadatos de forma organizada y de fácil acceso.
La sintaxis de Hive es similar a la de SQL, por lo que para alguien familiarizado con SQL, aprender a usar Hive es prácticamente intuitivo. Sin embargo, hoy en día existen otras herramientas que pueden hacer lo mismo con mayor rapidez. Al principio, Hive era muy útil; pero ahora hay cada vez más proyectos disponibles para realizar operaciones similares a SQL en Big Data (como Drill).
Hive es comparativamente más lento que sus competidores. Es fácil de usar, pero esto conlleva un coste de procesamiento. Si lo usas solo para procesamiento por lotes, Hive es una buena opción. Además, su lenguaje de scripting no es tan completo.
En el sector minorista, los socios comerciales se sienten más cómodos consultando sus propios datos en lugar de depender de ingenieros. Hive resuelve uno de estos problemas. El objetivo principal de Hive es generar informes y analizar los datos almacenados en el sistema de archivos Hadoop.
Nada en particular. Nos ayuda con big data y permite que todos los usuarios tengan ancho de banda sin restricciones, pero ya nos encontramos con problemas con eso, por lo que ahora uno de los servidores tiene limitaciones.
En mi empresa fue bastante problemático obtener acceso ya que el almacenamiento subyacente está en Hadoop, y luego hay que conectarse a través de Hive.
Información sobre datos con grandes datos del navegador a través de MapReduce
Sintaxis sencilla similar a SQL para consultas muy cortas y sencillas
Sin alias para la relación. Tampoco hay controles de flujo.
Desarrollo un modelo de aprendizaje automático para un sistema de publicidad online. Para mí, Hive es más como un motor de consultas ad hoc que una plataforma donde puedo desarrollar algoritmos complejos.