一文带你搞懂数据仓库是什么？

时间：2023-08-11 15:13:38 来源：作者：IT技术管理那些事儿

数据仓库的诞生原因

随着互联网的普及，信息技术已经深入到各行各业，并逐步融入到企业的日常运营中。然而，当前企业在信息化建设过程中遇到了一些困境与挑战。

1、历史数据积存。过去企业的业务系统往往是在较长时间内建设的，很少进行大面积的改造或者升级，历史数据留存在业务系统中。随着业务的不断增长，历史数据使用频率低，业务数据库中的历史数据越来越多，大量历史数据堆积，从而影响了业务数据库的性能。

2、信息系统分散。企业各个部门自己建立的独立数据抽取系统会导致数据不一致，难以进行数据整合，不同系统的数据口径不统一、不规范。这导致了数据结构复杂，开发难度大，分析难以标准化，数据应用难度大。

企业信息系统分散

业务数据库面向于业务系统，而数据仓库面向于业务分析。为了满足企业数据分析需要，数据仓库应运而生。

数据仓库的基本特点

数据仓库主要用来对寄存的历史数据进行存储和管理，并使用一些分析方法对数据进行分析和整理（如OLAP、数据分析），从而提供大量数据支持，为企业构建BI打下坚实基础。

数据仓库有以下特点：

1、集成的：原始数据是从多个数据源获得，如文件、数据库等。要将这些来源不同的原始数据整合到一个数据库中，就必须对这些源进行抽取、清洗、转换。

2、面向主题的：数据仓库为数据分析提供服务，根据主题将原始数据集合在一起。

数仓特点：面向主题

3、时变性：数据仓库会定期接受、集成新的数据，从而反映出数据的最新变化。

4、非易失性：数据仓库中保存的数据是一系列历史快照，一旦进入数据仓库，就不允许被修改。同时，对数据仓库中保存的数据进行查询、分析时，也只能通过专门的工具进行。

数仓特点：非易失性

数据仓库和数据库的区别

数据库是面向事务设计的，主要操作是随机读写。在设计过程中，为了避免冗余，常采用符合范式的规范来设计。

数据仓库是面向主题设计的，主要操作为批量读取和写入。数据仓库关注数据整合和分析，会引入冗余，采用反范式的方式进行设计。

数据库和数据仓库的对比

数据仓库建设方案

传统数据仓库和大数据数据仓库是两种不同类型的数据仓库，需要采用不同的建设方案。

传统数据仓库通常是由关系型数据库组成的 MPP （大规模并行处理）集群来进行数据存储和运算，采用一定的数据模型，如星型模型、雪花模型等，来设计数据仓库的结构。但是，随着应用系统的发展，其扩展性受到了很大限制，并且随着业务应用的不断增加，也逐渐产生了一些热点问题。

传统数据仓库的热点问题

大数据数据仓库通常采用分布式计算技术，如Hadoop、Spark等作为存储和计算引擎，使用工具或编程语言设计处理逻辑，实现对不同数据源的汇聚、清洗、计算和分析。大数据数据仓库利用了大数据天然的扩展性来完成海量数据的存放，同时也把SQL转换成了针对大数据计算引擎的任务，实现数据的分析。虽然大数据数据仓库具有很多优点，但是仍然存在一些挑战和问题：

1. SQL的支持率比较低。大数据计算引擎有自己的语言和逻辑，所以有些SQL查询无法很好地转换成它们能够理解的任务。

2. 缺少事务支持。因为大数据计算引擎本质上是分布式的，并且数据分散在多个节点上，所以很难实现完整的事务支持。

3. 数据量较少时计算速度可能比较慢。大数据数据仓库可以通过计算资源的横向扩展来提高计算速度，所以当数据量较少时，可能需要较长的时间来完成分析。

大数据数仓

现在企业的信息化建设和数据仓库的构建面临很多挑战，需要根据企业的现状和需要解决的问题，选择合适的方案，不能一蹴而就。很显然在目前的信息时代，借助类似于FineDataLink的这些工具，可以让企业加速融入企业数据集成和分析的趋势。

Tags：数据仓库点击:() 评论:()

声明：本站部分内容及图片来自互联网,转载是出于传递更多信息之目的,内容观点仅代表作者本人,不构成投资建议。投资者据此操作，风险自担。如有任何标注错误或版权侵犯请与我们联系，我们将及时更正、删除。

▌相关推荐

从Clickhouse迁移到Doris，数据仓库性能大提升

从一个OLAP数据库迁移到另一个数据库是一项艰巨的工程。即使能找到一些有用的数据工具，您可能仍会犹豫是否对数据架构进行大手术，因为不确定如何运作。本文分享如何从ClickHou...【详细内容】

2023-11-17　　Search: 数据仓库点击:(201)　　评论:(0)　　加入收藏

数据仓库与SQL数据库有什么区别

首先，定义三个概念：数据库软件、数据库、数据仓库。数据库软件：是一种软件，可以看得见，可以操作。用来实现数据库逻辑功能。属于物理层。数据库：是一种逻辑概念，用来存放数据的仓库...【详细内容】

2023-11-13　　Search: 数据仓库点击:(183)　　评论:(0)　　加入收藏

从数据池或大数据仓库到数据湖

这篇博文讨论了从数据池/大数据仓库到数据湖的演变。它探讨了传统数据仓库的局限性以及数据湖在可扩展性、敏捷性和自助服务方面的优势。这篇文章还涵盖了数据仓库的基本功...【详细内容】

2023-11-10　　Search: 数据仓库点击:(270)　　评论:(0)　　加入收藏

谈谈数据仓库中的数据建模优秀实践

开发和生成数据库中使用的数据概念表示的过程称为数据建模。数据仓库上下文中的数据建模是创建将存储在数据仓库中的数据的逻辑表示的过程。数据仓库中数据建模的目标是建立...【详细内容】

2023-10-08　　Search: 数据仓库点击:(356)　　评论:(0)　　加入收藏

数据仓库与数据分析架构：驱动数据驱动决策

在当今信息爆炸的时代，数据已经成为了企业决策的核心资产。数据仓库与数据分析架构的崛起，为企业提供了有效地管理和分析海量数据的解决方案，实现了数据驱动决策的愿景。这个强...【详细内容】