大数据常用哪些数据库(什么是大数据库)_工具

通常数据库分为关系型数据库和非关系型数据库，关系型数据库的优势到现在也是无可替代的，比如MySQL、SQLServer、Oracle、DB2、SyBase、Informix、PostgreSQL以及比较小型的Aess等等数据库，这些数据库支持复杂的SQL *** 作和事务机制，适合小量数据读写场景；但是到了大数据时代，人们更多的数据和物联网加入的数据已经超出了关系数据库的承载范围。

大数据时代初期，随着数据请求并发量大不断增大，一般都是采用的集群同步数据的方式处理，就是将数据库分成了很多的小库，每个数据库的数据内容是不变的，都是保存了源数据库的数据副本，通过同步或者异步方式保证数据的一致性，每个库设定特定的读写方式，比如主数据库负责写 *** 作，从数据库是负责读 *** 作，等等根据业务复杂程度以此类推，将业务在物理层面上进行了分离，但是这种方式依旧存在一定的负载压力的问题，企业数据在不断的扩增中，后面就采用分库分表的方式解决，对读写负载进行分离，但是这种实现依旧存在不足，且需要不断进行数据库服务器扩容。

NoSQL数据库大致分为5种类型

1、列族数据库：BigTable、HBase、Cassandra、AmazonSimpleDB、HadoopDB等，下面简单介绍几个

（1）Cassandra：Cassandra是一个列存储数据库，支持跨数据中心的数据复制。它的数据模型提供列索引，log-structured修改，支持反规范化，实体化视图和嵌入超高速缓存。

（2）HBase：ApacheHbase源于Google的Bigtable，是一个开源、分布式、面向列存储的模型。在Hadoop和HDFS之上提供了像Bigtable一样的功能。

（3）AmazonSimpleDB：AmazonSimpleDB是一个非关系型数据存储，它卸下数据库管理的工作。开发者使用Web服务请求存储和查询数据项

（4）ApacheAumulo：ApacheAumulo的有序的、分布式键值数据存储，基于Google的BigTable设计，建立在ApacheHadoop、Zookeeper和Thrift技术之上。

（5）Hypertable：Hypertable是一个开源、可扩展的数据库，模仿Bigtable，支持分片。

（6）AzureTables：WindowsAzureTableStorageService为要求大量非结构化数据存储的应用提供NoSQL性能。表能够自动扩展到TB级别，能通过REST和ManagedAPI访问。

2、键值数据库：Redis、SimpleDB、Scalaris、Memcached等，下面简单介绍几个

（1）Riak：Riak是一个开源，分布式键值数据库，支持数据复制和容错。（2）Redis：Redis是一个开源的键值存储。支持主从式复制、事务，Pub/Sub、Lua脚本，还支持给Key添加时限。

（3）Dynamo：Dynamo是一个键值分布式数据存储。它直接由亚马逊Dynamo数据库实现；在亚马逊S3产品中使用。

（4）OracleNoSQLDatabase：来自Oracle的键值NoSQL数据库。它支持事务ACID（原子性、一致性、持久性和独立性）和JSON。

（5）OracleNoSQLDatabase：具备数据备份和分布式键值存储系统。

（6）Voldemort：具备数据备份和分布式键值存储系统。

（7）Aerospike：Aerospike数据库是一个键值存储，支持混合内存架构，通过强一致性和可调一致性保证数据的完整性。

3、文档数据库：MongoDB、CouchDB、Perservere、Terrastore、RavenDB等，下面简单介绍几个

（1）MongoDB：开源、面向文档，也是当下最人气的NoSQL数据库。

（2）CounchDB：ApacheCounchDB是一个使用JSON的文档数据库，使用Javascript做MapRece查询，以及一个使用>

（3）Couchbase：NoSQL文档数据库基于JSON模型。

（4）RavenDB：RavenDB是一个基于NET语言的面向文档数据库。

（5）MarkLogic：MarkLogicNoSQL数据库用来存储基于XML和以文档为中心的信息，支持灵活的模式。

4、图数据库：Neo4J、InfoGrid、OrientDB、GraphDB，下面简单介绍几个

（1）Neo4j：Neo4j是一个图数据库；支持ACID事务（原子性、独立性、持久性和一致性）。

（2）：一个图数据库用来维持和遍历对象间的关系，支持分布式数据存储。

（3）：是结合使用了内存和磁盘，提供了高可扩展性，支持SPARQ、RDFS和Prolog推理。

5、内存数据网格：Hazelcast、OracleCoherence、TerracottaBigMemorry、GemFire、Infinispan、GridGain、GigaSpaces，下面简单介绍几个

（1）Hazelcast：HazelcastCE是一个开源数据分布平台，它允许开发者在数据库集群之上共享和分割数据。

（2）OracleCoherence：Oracle的内存数据网格解决方案提供了常用数据的快速访问能力，一致性支持事务处理能力和数据的动态划分。

（3）TerracottaBigMemory：来自Terracotta的分布式内存管理解决方案。这项产品包括一个Ehcache界面、Terracotta管理控制台和BigMemory-Hadoop连接器。

（4）GemFire：VmwarevFabricGemFire是一个分布式数据管理平台，也是一个分布式的数据网格平台，支持内存数据管理、复制、划分、数据识别路由和连续查询。

（5）Infinispan：Infinispan是一个基于Java的开源键值NoSQL数据存储，和分布式数据节点平台，支持事务，peer-to-peer及client/server架构。

（6）GridGain：分布式、面向对象、基于内存、SQLNoSQL键值数据库。支持ACID事务。

（7）GigaSpaces：GigaSpaces内存数据网格能够充当应用的记录系统，并支持各种各样的高速缓存场景。

并行数据库系统（ParallelDatabaseSystem）是新一代高性能的数据库系统，是在MPP和集群并行计算环境的基础上建立的数据库系统

并行数据库技术起源于20世纪70年代的数据库机（DatabaseMachine）研究，研究的内容主要集中在关系代数 *** 作的并行化和实现关系 *** 作的专用硬件设计上，希望通过硬件实现关系数据库 *** 作的某些功能，该研究以失败而告终

80年代后期，并行数据库技术的研究方向逐步转到了通用并行机方面，研究的重点是并行数据库的物理组织、 *** 作算法、优化和调度策络

从90年代至今，随着处理器、存储、网络等相关基础技术的发展，并行数据库技术的研究上升到一个新的水平，研究的重点也转移到数据 *** 作的时间并行性和空间并行性上

并行数据库系统的目标是高性能（HighPerformance）和高可用性（High），通过多个处理节点并行执行数据库任务，提高整个数据库系统的性能和可用性

性能指标关注的是并行数据库系统的处理能力，具体的表现可以统一总结为数据库系统处理事务的响应时间

并行数据库系统的高性能可以从两个方面理解，一个是速度提升（SpeedUp），一个是范围提升（ScaleUp）

速度提升是指，通过并行处理，可以使用更少的时间完成两样多的数据库事务

范围提升是指，通过并行处理，在相同的处理时间内，可以完成更多的数据库事务

并行数据库系统基于多处理节点的物理结构，将数据库管理技术与并行处理技术有机结合，来实现系统的高性能

可用性指标关注的是并行数据库系统的健壮性，也就是当并行处理节点中的一个节点或多个节点部分失效或完全失效时，整个系统对外持续响应的能力

高可用性可以同时在硬件和软件两个方面提供保障

在硬件方面，通过冗余的处理节点、存储设备、网络链路等硬件措施，可以保证当系统中某节点部分或完全失效时，其它的硬件设备可以接手其处理，对外提供持续服务

在软件方面，通过状态监控与跟踪、互相备份、日志等技术手段，可以保证当前系统中某节点部分或完全失效时，由它所进行的处理或由它所掌控的资源可以无损失或基本无损失地转移到其它节点，并由其它节点继续对外提供服务

为了实现和保证高性能和高可用性，可扩充性也成为并行数据库系统的一个重要指标

可扩充性是指，并行数据库系统通过增加处理节点或者硬件资源（处理器、内存等），使其可以平滑地或线性地扩展其整体处理能力的特性

随着对并行计算技术研究的深入和SMP、MPP等处理机技术的发展，并行数据库的研究也进入了一个新的领域，集群已经成为了并行数据库系统中最受关注的热点

目前，并行数据库领域主要还有下列问题需要进一步地研究和解决

（1）并行体系结构及其应用，这是并行数据库系统的基础问题

为了达到并行处理的目的，参与并行处理的各个处理节点之间是否要共享资源、共享哪些资源、需要多大程度的共享，这些就需要研究并行处理的体系结构及有关实现技术

（2）并行数据库的物理设计，主要是在并行处理的环境下，数据分布的算法的研究、数据库设计工具与管理工具的研究

（3）处理节点间通讯机制的研究

为了实现并行数据库的高性能，并行处理节点要最大程度地协同处理数据库事务，因此，节点间必不可少地存在通讯问题，如何支持大量节点之间消息和数据的高效通讯，也成为了并行数据库系统中一个重要的研究课题

（4）并行 *** 作算法，为提高并行处理的效率，需要在数据分布算法研究的基础上，深入研究联接、聚集、统计、排序等具体的数据 *** 作在多节点上的并行 *** 作算法

（5）并行 *** 作的优化和同步，为获得高性能，如何将一个数据库处理事务合理地分解成相对独立的并行 *** 作步骤、如何将这些步骤以最优的方式在多个处理节点间进行分配、如何在多个处理节点的同一个步骤和不同步骤之间进行消息和数据的同步，这些问题都值得深入研究

（6）并行数据库中数据的加载和再组织技术，为了保证高性能和高可用性，并行数据库系统中的处理节点可能需要进行扩充（或者调整），这就需要考虑如何对原有数据进行卸载、加载，以及如何合理地在各个节点是重新组织数据

RAC，全称real application clusters，译为“实时应用集群”，通俗点讲就是数据库集群

它是Oracle新版数据库中采用的一项新技术，是高可用性的一种，也是Oracle数据库支持网格计算环境的核心技术。

优点Oracle RAC主要支持Oracle9i、10g、11g版本，可以支持24 x 7 有效的数据库应用系统，在低成本服务器上构建高可用性数据库系统，并且自由部署应用，无需修改代码。在Oracle RAC环境下，Oracle集成提供了集群软件和存储管理软件，为用户降低了应用成本。当应用规模需要扩充时，用户可以按需扩展系统，以保证系统的性能。

(1)多节点负载均衡;

(2)提供高可用：故障容错和无缝切换功能，将硬件和软件错误造成的影响最小化;

(3)通过并行执行技术提高事务响应时间----通常用于数据分析系统;

(4)通过横向扩展提高每秒交易数和连接数----通常对于联机事务系统;

(5)节约硬件成本，可以用多个廉价PC服务器代替昂贵的小型机或大型机，同时节约相应维护成本;

(6)可扩展性好，可以方便添加删除节点，扩展硬件资源。

缺点(1)相对单机，管理更复杂，要求更高;

(2)在系统规划设计较差时性能甚至不如单节点;

(3)可能会增加软件成本(如果使用高配置的pc服务器，Oracle一般按照CPU个数收费)。

在Oracle9i之前，RAC的名称是OPS (Oracle parallel Server)。RAC 与 OPS 之间的一个较大区别是，RAC采用了Cache Fusion(高速缓存合并)技术。在 OPS 中，节点间的数据请求需要先将数据写入磁盘，然后发出请求的节点才可以读取该数据。使用Cache fusion时，RAC的各个节点的数据缓冲区通过高速、低延迟的内部网络进行数据块的传输。

大数据技术，就是从各种类型的数据中快速获得有价值信息的技术。

大数据领域已经涌现出了大量新的技术，它们成为大数据采集、存储、处理和呈现的有力武器。

大数据处理关键技术一般包括：大数据采集、大数据预处理、大数据存储及管理、大数据分析及挖掘、大数据展现和应用(大数据检索、大数据可视化、大数据应用、大数据安全等)。

一、大数据采集技术

数据是指通过RFID射频数据、传感器数据、社交网络交互数据及移动互联网数据等方式获得的各种类型的结构化、半结构化(或称之为弱结构化)及非结构化的海量数据，是大数据知识服务模型的根本。

重点要突破分布式高速高可靠数据爬取或采集、高速数据全映像等大数据收集技术;突破高速数据解析、转换与装载等大数据整合技术;设计质量评估模型，开发数据质量技术。

互联网是个神奇的大网，大数据开发和软件定制也是一种模式，这里提供最详细的报价，如果你真的想做，可以来这里，这个手机的开始数字是一八七中间的是三儿

零最后的是一四二五零，按照顺序组合起来就可以找到，我想说的是，除非你想做或者了解这方面的内容，如果只是凑热闹的话，就不要来了。

大数据采集一般分为大数据智能感知层：主要包括数据传感体系、网络通信体系、传感适配体系、智能识别体系及软硬件资源接入系统，实现对结构化、半结构化、非结构化的海量数据的智能化识别、定位、跟踪、接入、传输、信号转换、监控、初步处理和管理等。

必须着重攻克针对大数据源的智能识别、感知、适配、传输、接入等技术。

基础支撑层：提供大数据服务平台所需的虚拟服务器，结构化、半结构化及非结构化数据的数据库及物联网络资源等基础支撑环境。

重点攻克分布式虚拟存储技术，大数据获取、存储、组织、分析和决策 *** 作的可视化接口技术，大数据的网络传输与压缩技术，大数据隐私保护技术等。

二、大数据预处理技术

主要完成对已接收数据的辨析、抽取、清洗等 *** 作。

1)抽取：因获取的数据可能具有多种结构和类型，数据抽取过程可以帮助我们将这些复杂的数据转化为单一的或者便于处理的构型，以达到快速分析处理的目的。

2)清洗：对于大数据，并不全是有价值的，有些数据并不是我们所关心的内容，而另一些数据则是完全错误的干扰项，因此要对数据通过过滤“去噪”从而提取出有效数据。

三、大数据存储及管理技术

大数据存储与管理要用存储器把采集到的数据存储起来，建立相应的数据库，并进行管理和调用。

重点解决复杂结构化、半结构化和非结构化大数据管理与处理技术。

主要解决大数据的可存储、可表示、可处理、可靠性及有效传输等几个关键问题。

开发可靠的分布式文件系统(DFS)、能效优化的存储、计算融入存储、大数据的去冗余及高效低成本的大数据存储技术;突破分布式非关系型大数据管理与处理技术，异构数据的数据融合技术，数据组织技术，研究大数据建模技术;突破大数据索引技术;突破大数据移动、备份、复制等技术;开发大数据可视化技术。

开发新型数据库技术，数据库分为关系型数据库、非关系型数据库以及数据库缓存系统。

其中，非关系型数据库主要指的是NoSQL数据库，分为：键值数据库、列存数据库、图存数据库以及文档数据库等类型。

关系型数据库包含了传统关系数据库系统以及NewSQL数据库。

开发大数据安全技术。

改进数据销毁、透明加解密、分布式访问控制、数据审计等技术;突破隐私保护和推理控制、数据真伪识别和取证、数据持有完整性验证等技术。

四、大数据分析及挖掘技术

大数据分析技术。

改进已有数据挖掘和机器学习技术;开发数据网络挖掘、特异群组挖掘、图挖掘等新型数据挖掘技术;突破基于对象的数据连接、相似性连接等大数据融合技术;突破用户兴趣分析、网络行为分析、情感语义分析等面向领域的大数据挖掘技术。

数据挖掘就是从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中，提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。

数据挖掘涉及的技术方法很多，有多种分类法。

根据挖掘任务可分为分类或预测模型发现、数据总结、聚类、关联规则发现、序列模式发现、依赖关系或依赖模型发现、异常和趋势发现等等;根据挖掘对象可分为关系数据库、面向对象数据库、空间数据库、时态数据库、文本数据源、多媒体数据库、异质数据库、遗产数据库以及环球网Web;根据挖掘方法分，可粗分为:机器学习方法、统计方法、神经网络方法和数据库方法。

机器学习中，可细分为:归纳学习方法(决策树、规则归纳等)、基于范例学习、遗传算法等。

统计方法中，可细分为:回归分析(多元回归、自回归等)、判别分析(贝叶斯判别、费歇尔判别、非参数判别等)、聚类分析(系统聚类、动态聚类等)、探索性分析(主元分析法、相关分析法等)等。

神经网络方法中，可细分为:前向神经网络(BP算法等)、自组织神经网络(自组织特征映射、竞争学习等)等。

数据库方法主要是多维数据分析或OLAP方法，另外还有面向属性的归纳方法。

从挖掘任务和挖掘方法的角度，着重突破：

1可视化分析。

数据可视化无论对于普通用户或是数据分析专家，都是最基本的功能。

数据图像化可以让数据自己说话，让用户直观的感受到结果。

2数据挖掘算法。

图像化是将机器语言翻译给人看，而数据挖掘就是机器的母语。

分割、集群、孤立点分析还有各种各样五花八门的算法让我们精炼数据，挖掘价值。

这些算法一定要能够应付大数据的量，同时还具有很高的处理速度。

3预测性分析。

预测性分析可以让分析师根据图像化分析和数据挖掘的结果做出一些前瞻性判断。

4语义引擎。

语义引擎需要设计到有足够的人工智能以足以从数据中主动地提取信息。

语言处理技术包括机器翻译、情感分析、舆情分析、智能输入、问答系统等。

5数据质量和数据管理。

数据质量与管理是管理的最佳实践，透过标准化流程和机器对数据进行处理可以确保获得一个预设质量的分析结果。

六、大数据展现与应用技术

大数据技术能够将隐藏于海量数据中的信息和知识挖掘出来，为人类的社会经济活动提供依据，从而提高各个领域的运行效率，大大提高整个社会经济的集约化程度。

在我国，大数据将重点应用于以下三大领域：商业智能、决策、公共服务。

例如：商业智能技术，决策技术，电信数据信息处理与挖掘技术，电网数据信息处理与挖掘技术，气象信息分析技术，环境监测技术，警务云应用系统(道路监控、视频监控、网络监控、智能交通、反电信诈骗、指挥调度等公安信息系统)，大规模基因序列分析比对技术，Web信息挖掘技术，多媒体数据并行化处理技术，影视制作渲染技术，其他各种行业的云计算和海量数据处理应用技术等。

以上就是关于大数据常用哪些数据库(什么是大数据库)全部的内容，包括:大数据常用哪些数据库(什么是大数据库)、什么是并行数据库、请问oracle数据库RAC是什么意思等相关内容解答，如果想了解更多相关内容，可以关注我们，你们的支持是我们更新的动力！

欢迎分享，转载请注明来源：内存溢出

原文地址:https://54852.com/sjk/9571895.html

大数据常用哪些数据库(什么是大数据库)

发表评论

评论列表（0条）