加入收藏 | 设为首页 | 会员中心 | 我要投稿 李大同 (https://www.lidatong.com.cn/)- 科技、建站、经验、云计算、5G、大数据,站长网!
当前位置: 首页 > 大数据 > 正文

大数据从百万级别数据的分析角度,数据库如何选择?

发布时间:2020-12-14 02:56:44 所属栏目:大数据 来源:网络整理
导读:问题描述: 现在需要做一个数据存储,500w左右的数据,日后每天大约产生5w条左右的数据。想把这些数据存储起来,供日后的数据分析用?使用上面说的三种数据库中的哪中比较好?是否有必要建立集群? 个人看法是:从长远角度看,由于单台机器的性能瓶颈,后期

问题描述:


现在需要做一个数据存储,500w左右的数据,日后每天大约产生5w条左右的数据。想把这些数据存储起来,供日后的数据分析用?使用上面说的三种数据库中的哪中比较好?是否有必要建立集群?

个人看法是:从长远角度看,由于单台机器的性能瓶颈,后期肯定要做集群,单纯的做复制最终也无法缓解单台master上读的负担。因此,使用mysql的话会使用cluser。但是了解到mysql的cluser要用好的化还要做负载均衡,而mysql的均衡器是第三方的,无法很好的与mysql整合。使用mongodb的自动分片集群能很好的解决这个问题,而且它的读写性能也快。Hbase提供了大数据存储的解决方案。


回到我问题,最终是要在大数据的基础上做数据分析,虽然mongodb也能与Mapreduce整合,但想必Hbase做这一块会更有优势。



答案:


百万级的数据,无论侧重OLTP还是OLAP,当然就是MySql了。

过亿级的数据,侧重OLTP可以继续Mysql,侧重OLAP,就要分场景考虑了。

实时计算场景:强调实时性,常用于实时性要求较高的地方,可以选择Storm;

批处理计算场景:强调批处理,常用于数据挖掘、分析,可以选择Hadoop;

实时查询场景:强调查询实时响应,常用于把DB里的数据转化索引文件,通过搜索引擎来查询,可以选择solr/elasticsearch;

企业级ODS/EDW/数据集市场景:强调基于关系性数据库的大数据实时分析,常用于业务数据集成,可以选择Greenplum;


数据库系统一般分为两种类型:


  • 一种是面向前台应用的,应用比较简单,但是重吞吐和高并发的OLTP类型;

  • 一种是重计算的,对大数据集进行统计分析的OLAP类型。


传统数据库侧重交易处理,即OLTP,关注的是多用户的同时的双向操作,在保障即时性的要求下,系统通过内存来处理数据的分配、读写等操作,存在IO瓶颈。


OLTP(On-LineTransactionProcessing,联机事务处理)系统也称为生产系统,它是事件驱动的、面向应用的,比如电子商务网站的交易系统就是一个典型的OLTP系统。


OLTP的基本特点是:


  • 数据在系统中产生;

  • 基于交易的处理系统(Transaction-Based);

  • 每次交易牵涉的数据量很小;

  • 对响应时间要求非常高;

  • 用户数量非常庞大,主要是操作人员;


数据库的各种操作主要基于索引进行。


分析型数据库是以实时多维分析技术作为基础,即侧重OLAP,对数据进行多角度的模拟和归纳,从而得出数据中所包含的信息和知识。


OLAP(On-LineAnalyticalProcessing,联机分析处理)是基于数据仓库的信息分析处理过程,是数据仓库的用户接口部分。OLAP系统是跨部门的、面向主题的,其基本特点是:


  • 本身不产生数据,其基础数据来源于生产系统中的操作数据(OperationalData);

  • 基于查询的分析系统;

  • 复杂查询经常使用多表联结、全表扫描等,牵涉的数据量往往十分庞大;

  • 响应时间与具体查询有很大关系;

  • 用户数量相对较小,其用户主要是业务人员与管理人员;



  第八届中国大数据技术大会(BigData Technology Conference 2014,BDTC 2014)将于2014年12月12日-14日在北京新云南皇冠假日酒店召开。传承自2008年,历经七届沉淀,“中国大数据技术大会”是目前国内最具影响、规模最大的大数据领域技术盛会。本届会议,你不仅可以了解到Apache Hadoop提交者Uma Maheswara Rao G(兼项目管理委员会成员)、Yi Liu,以及Apache Hadoop和Tez项目管理委员会成员Bikas Saha等分享的通用大数据开源项目的最新成果和发展趋势,还将斩获来自腾讯、阿里、Cloudera、LinkedIn、网易等50余位工程师带来的近 60场干货分享。


门票限时折扣中,预购从速(http://bdtc2014.hadooper.cn/m/zone/bdtc_2014/buy_ticket)


(编辑:李大同)

【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容!

    推荐文章
      热点阅读