六何分析法:(5W1H:Why / What / Where / When / Who / How)
1. Why(为什么要用 Hive?解决什么问题)直接用 MapReduce 写大数据分析 ,代码复杂 、开发慢数据分析师、业务人员不会写 Java/Spark,只会 SQL海量日志、用户行为数据需要离线统计 、报表分析需要把 HDFS 上的文件当成 “数据库表” 来方便查询、一句话:Hive 就是为了让不懂底层分布式的人,能用 SQL 轻松做大数据分析 。
2. What(Hive 到底是什么)Hive 是基于 Hadoop 的数据仓库工具不是传统数据库 ,不支持高并发实时事务提供类 SQL 语法(HQL),底层翻译成 MR/Spark 任务把 HDFS 文件映射成表结构,元数据存在 MySQL 等数据库中核心定位:SQL 风格的大数据离线分析引擎。
3. Who(谁在使用 Hive)数据分析师:做统计、报表、多维分析数据开发工程师:ETL 清洗 、数据加工、数仓构建产品 / 运营:通过 Hive 查询用户行为、业务指标大数据平台运维:搭建 、管理 Hive 集群4. Where(Hive 数据存在哪、跑在哪)数据存储:HDFS(分布式文件系统)元数据存储:MySQL / PostgreSQL计算资源:YARN 调度运行环境:Hadoop 集群(服务器集群)简单关系:
5. When(什么时候用 Hive,什么时候不用)✅ 适合用 Hive海量数据离线统计(日活、留存 、销售额、漏斗)日志分析、用户行为分析数据仓库分层建模(ODS→DWD→DWS→ADS)批量 ETL 、数据清洗转换❌ 不适合用 Hive高并发实时查询(秒杀、订单实时查询)频繁单条增删改(OLTP 业务系统)低延迟实时计算(用 Flink/Spark Streaming 替代)6. How(Hive 如何工作 & 基本使用示例)工作原理输入 HQL 语句Driver 解析、编译 、优化转换成分布式任务(MR/Spark)YARN 分配资源执行从 HDFS 读取数据并计算返回结果Hive 表结构 → MySQL
Hive 真实数据 → HDFS
Hive 计算任务 → YARN + MapReduce/Spark
最简使用示例(How to use)
hive简要使用示例
本文来自作者[山灵]投稿,不代表点新号立场,如若转载,请注明出处:https://sc-hx.cn/jyan/202609-13497.html
评论列表(3条)
我是点新号的签约作者“山灵”
本文概览:hive数据库|(hive数据库版本)六何分析法:(5W1H:Why / What / Where / When / Who / How)1. Why(为什么要用 Hive?解...
文章不错《hive数据库|(hive数据库版本)》内容很有帮助