加入收藏 | 设为首页 | 会员中心 | 我要投稿 李大同 (https://www.lidatong.com.cn/)- 科技、建站、经验、云计算、5G、大数据,站长网!
当前位置: 首页 > 大数据 > 正文

预备工作——数据处理流程

发布时间:2020-12-14 04:53:29 所属栏目:大数据 来源:网络整理
导读:该项目是一个纯粹的数据分析项目,其整体流程基本上就是依据数据的处理流程进行,依此有以下几个大的步骤: 1) 数据采集 首先,通过页面嵌入JS代码的方式获取用户访问行为,并发送到web服务的后台记录日志 然后, 将各服务器上生成的点击流日志通过实时或批

该项目是一个纯粹的数据分析项目,其整体流程基本上就是依据数据的处理流程进行,依此有以下几个大的步骤:

1) 数据采集

首先,通过页面嵌入JS代码的方式获取用户访问行为,并发送到web服务的后台记录日志

然后,将各服务器上生成的点击流日志通过实时或批量的方式汇聚到HDFS文件系统中

?

当然,一个综合分析系统,数据源可能不仅包含点击流数据,还有数据库中的业务数据(如用户信息、商品信息、订单信息等)及对分析有益的外部数据

?

2) 数据预处理

通过mapreduce程序对采集到的点击流数据进行预处理,比如清洗,格式整理,滤除脏数据等

?

3) 数据入库

将预处理之后的数据导入到HIVE仓库中相应的库和表中

?

4) 数据分析

项目的核心内容,即根据需求开发ETL分析语句,得出各种统计结果

?

5) 数据展现

将分析所得数据进行可视化

(编辑:李大同)

【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容!

    推荐文章
      热点阅读