您当前的位置:首页 > 电脑百科 > 程序开发 > 编程百科

Tableau数据源详解

时间:2019-09-29 13:10:36  来源:  作者:
Tableau数据源详解

 

作者 | CDA数据分析师

Tableau内置的连接器可以连接到所有常用的数据源。

数据连接器

目前可以连接70多种数据源,分为本地连接和服务器连接。 Tableau支持的本地连接包括Excel、txt、csv、json等各类常见的源数据格式,还支持多种空间文件, 为使用地图分析提供了条件。

Tableau数据源详解

 

Tableau支持的服务连接包括各类数据库(如MySQL、Oracle、MongoDB)、在线数据服务(如google analtics)等,可以根据使用需要,与目标服务器建立连接关系。

Tableau数据源详解

 

如果以上提供的连接不满足您的需求,可以选择使用“其他数据库 (ODBC)”或“Web 数据连接器”创建自己的连接。

设置数据源

Tableau数据源是数据与Tableau之间的链接,本质上是数据、连接信息以及基于数据进行的自定义操作的总和。

数据源包含

  1. 有关数据存储位置的信息,例如文件名和路径或网络位置。
  2. 有关如何连接到数据的详细信息,例如数据库服务器名称和服务器登录信息。
  3. 连接中任何表的名称,以及有关各个表如何相互关联的信息。
  4. 基于数据进行的自定义,例如计算、组和重命名字段等。

本地文件连接

打开Tableau Desktop进入数据连接界面,在连接到文件中选择要连接的文件类型。这里以Excel文件为例,单击“Microsoft Excel”在弹出的“打开”对话框中找到想要连接的文件。

Tableau数据源详解

 

双击或拖动表名至画布区,下方会显示数据预览。

Tableau数据源详解

 

数据库连接

在数据连接界面,连接到服务器中选择要连接的服务器。这里以“MySQL”为例,单击“MySQL”在弹出“MySQL”对话框输入服务器IP、端口号、用户名及密码即可登录到MySQL服务器。

Tableau数据源详解

 

建立连接后,在数据库列表中选择要连接的数据库,下方会显示当前数据库下可用的工作表。双击或拖动表名至画布区,下方会显示数据预览。

Tableau数据源详解

 

也可以双击或拖动“新自定义SQL”至画布区,输入SELECT语句以连接想要的数据。

Tableau数据源详解

 


Tableau数据源详解

 

剪贴板粘贴

  • 在数据源选择好目标数据,并进行复制操作(Ctrl+C )。
  • 打开tableau,在连接窗口进行粘贴操作(Ctrl+V )。
  • 数据导入成功,tableau跳转到数据源页面。
Tableau数据源详解

 

组合数据源

在一个工作簿中可以同时创建不同的数据连接。

  • 连接到MySQL数据库后,点击“添加”在弹出的“添加连接”对话框中单击“文本文件”,在弹出的“打开”对话框中找到想要连接的文件。
Tableau数据源详解

 

  • 选择不同连接下的数据表先后双击或拖放至画布区,建立不同数据源下的表联结关系。
Tableau数据源详解

 

数据联结

当需要从多个数据表中获取数据时,则要用到数据联接操作。这里以两表联结为例,以两个表的共有字段作为关键字段来建立联结关系。 为了简单直观的操作演示,本文使用自制的Excel数据集demo,文件中包含table1和table2两个数据表。

Tableau数据源详解

 

 

联结方式

Tableau中支持四种联结方式:内联接、左联接、右联接和完全外部联接。通常情况,Tableau会自动判断两张表的关键字段并进行关联,如果关联不正确或关键字段不一致无法自动关联,可以手动进行关联。

Tableau数据源详解

 

  • 内联结:仅保留两个数据表中具有相同关键字段的行。
Tableau数据源详解

 

  • 左联结:包含左侧表中所有值以及右侧表中相对应的匹配值,如果右侧表中没有与左侧表相匹配的项,则会显示为null。
Tableau数据源详解

 

  • 右联结:包含右侧表中所有值以及左侧表中相对应的匹配值,如果左侧表中没有与右侧表相匹配的项,则会显示为null。
Tableau数据源详解

 

  • 完全外部联接:包含两个表中的所有值,如果一张表的值在另一张表中没有匹配项,则显示为null。

数据合并

当需要将有多个结构一致的数据表整合汇总在一起时,则可以使用数据合并。数据联接是横向扩展,数据合并是纵向增加。 进行数据合并的要求是,每个数据表的==字段名、个数、顺序和数据类型必须完全一致==。 为了简单直观的操作演示,本文使用自制的Excel数据集demo,文件中包含三个数据表。

Tableau数据源详解

 


Tableau数据源详解

 


Tableau数据源详解

 

手动数据合并

双击或拖放“新建并集”至画布区,将需要合并的数据表拖入弹出的并集(手动)对话框。

Tableau数据源详解

 

合并后的数据表包含三个数据表的所有数据,并且各字段一一对应。需要注意的是,新增了sheet和table%20name两个字段,用于说明并集中的值的来源。

自动数据合并

双击或拖放“新建并集”至画布区,在弹出的“并集”对话框中选择“通配符(自动)”。%20在“工作表”位置,将匹配内容改写为“班”,其中“班”是共有的名称,是通配符,用于匹配三个工作表。

 

 

合并后的数据表包含三个数据表的所有数据,并且各字段一一对应。需要注意的是,新增了path、sheet两个字段,用于说明并集中的值的来源路径及表名称。

数据连接方式

与数据源完成连接后,将数据表拖放至画布区,就可以在画布区看到“连接”方式的选择,分别是“实时”和“数据提取”。 实时:直接从数据源实时查询获取数据信息,Tableau不对源数据进行存储。 数据提取:将数据源的数据保存到本地计算机,大幅缩短Tableau查询载入源数据的时间。

为什么有两种连接方式

  • 因为很多时候数据源的数据量很大,如果我们选择实时连接,会严重影响计算机的运行效率和性能。因此提供了数据提取的功能,可以只提取小部分数据到本地,开发完毕部署的时候,再选择实时连接获取全部最新的数据。
  • 使用数据提取会在本地创建一个数据源的副本,然后可以在其他计算机上继续我们的工作,也可以把打包工作簿分享给那些无法直接访问数据源的用户。

数据提取

数据提取是保存的数据子集。%20在创建数据的数据提取时,可以通过使用筛选器和配置其他限制来减少数据总数。%20创建数据提取后,可使用原始数据中的数据对其进行刷新。在刷新数据时,可以选择进行完全刷新或增量刷新。 完全刷新:默认方式,每次都会重新获取数据源的数据,创建的本地副本与数据源一致。 增量刷新:仅刷新自上次数据提取后新增的行。

数据提取的优势

  • 支持大型数据集:可以创建包含数十亿行数据的数据提取。
  • 快速创建:如果使用大型数据集,则创建和使用数据提取可能比使用原始数据更快。
  • 帮助提高性能:数据提取会在本地创建数据源的副本,不受服务器性能及网络的影响,大大提高了运行效率。
  • 支持附加功能:数据提取可以利用原始数据不支持的Tableau功能,例如不重复计数计算功能。
  • 提供对数据的离线访问权限:当原始数据不可用时,数据提取允许在本地保存和处理数据。

创建数据提取

选择数据提取后,会显示“编辑”和“刷新”按钮。单击“编辑”在弹出的“数据提取”对话框中设置数据提取的要求。

 

指定在数据提取中存储数据的方式

  • 单个表:用于存储数据提取数据的默认结构,当使用数据提取筛选器、聚合、前 N 个等,可以使用“单个表”存储数据。
  • 多个表:当表之间的所有联结均为等值 (=) 联结,联结关键字段的数据类型完全相同,未使用直通函数 (RAWSQL),未配置增量刷新、数据提取筛选器、“前 N 个”或抽样的情况下,可以使用“多个表”方式存储数据提取。

PS:“单个表”和“多个表”选项只会影响数据提取中数据的存储方式,不影响数据提取中的表在“数据源”页面上的显示方式。 假设您的数据提取由三个表组成。如果直接打开配置为使用默认选项“单个表”的数据提取 (.hyper) 文件,在“数据源”页面上只会显示一个表。但是,如果打开使用打包数据源 (.tdsx) 文件的数据提取或包含其对应数据提取 (.hyper) 文件的数据源 (.tdsx) 文件,在“数据源”页面上可以看到包含数据提取的全部三个表。

指定要提取的数据量

  • 筛选器:添加一个或多个筛选器,基于字段及字段值限制提取的数据量。
  • 聚合:选择“聚合可视维度的数据”以使用度量的默认聚合,对数据进行聚合来合并行,可以最大限度地减少数据提取文件的大小并提高性能。 选择对数据进行聚合时,也可以选择按指定的日期级别(例如“年”、“月”等)来“汇总日期”。
Tableau数据源详解

 

  • 行数:可以提取所有行或前N行。Tableau首先会应用筛选器和聚合,然后从经过筛选和聚合的结果中提取行数。 并非所有数据源都支持抽样。因此,在“提取数据”对话框中可能会看不到“抽样”选项。 数据提取中将不包括最初在“数据源”页面或工作表标签页中隐藏的任何字段。单击“隐藏所有未使用的字段”按钮可将这些隐藏字段从数据提取中移除。

设置完成后,单击工作表标签页可启动数据提取创建过程。在随后显示的对话框中,选择一个用于保存数据提取的位置,为该数据提取文件指定名称,然后单击“保存”即可。

在抽样数据与整个数据提取之间切换

当您使用大型数据提取时,您可能需要创建一个带数据样本的数据提取,以便每次将字段放在工作表标签页中的功能区上时,您都可以设置视图,同时避免长时间查询。然后,可以在使用带数据样本的数据提取和使用整个数据源之间进行切换,方法是在“数据”菜单中选择数据源,然后选择“使用数据提取”。

实时和数据提取的选择

什么情况下选择“实时”

  • 源数据的保密性要求较高,处于安全考虑不希望保存到本地时,可以采取实时连接的方式。
  • 需要实时更新源数据信息,并且对实时性的要求较高时,可以选择实时连接的方式。

什么情况下选择“数据提取”

  • 不便于实时连接数据源,如数据是通过本地服务器获取,但又需要在别的电脑进行分析时,可以通过”数据提取“将所需分析的数据保存到本地电脑。
  • 分析的数据量较大,需要提高数据载入效率,降低源数据库的访问压力时,可以通过数据提取将数据转移到本地计算机。
Tableau数据源详解

 

想要获取更多新鲜资讯和优质内容,可搜索进入我们的CDA小程序,不要错过了哟...



Tags:Tableau数据源   点击:()  评论:()
声明:本站部分内容及图片来自互联网,转载是出于传递更多信息之目的,内容观点仅代表作者本人,如有任何标注错误或版权侵犯请与我们联系(Email:2595517585@qq.com),我们将及时更正、删除,谢谢。
▌相关推荐
目前可以连接70多种数据源,分为本地连接和服务器连接。 Tableau支持的本地连接包括Excel、txt、csv、json等各类常见的源数据格式,还支持多种空间文件, 为使用地图分析提供了条件。...【详细内容】
2019-09-29  Tags: Tableau数据源  点击:(204)  评论:(0)  加入收藏
▌简易百科推荐
本文分为三个等级自顶向下地分析了glibc中内存分配与回收的过程。本文不过度关注细节,因此只是分别从arena层次、bin层次、chunk层次进行图解,而不涉及有关指针的具体操作。前...【详细内容】
2021-12-28  linux技术栈    Tags:glibc   点击:(3)  评论:(0)  加入收藏
摘 要 (OF作品展示)OF之前介绍了用python实现数据可视化、数据分析及一些小项目,但基本都是后端的知识。想要做一个好看的可视化大屏,我们还要学一些前端的知识(vue),网上有很多比...【详细内容】
2021-12-27  项目与数据管理    Tags:Vue   点击:(2)  评论:(0)  加入收藏
程序是如何被执行的  程序是如何被执行的?许多开发者可能也没法回答这个问题,大多数人更注重的是如何编写程序,却不会太注意编写好的程序是如何被运行,这并不是一个好...【详细内容】
2021-12-23  IT学习日记    Tags:程序   点击:(9)  评论:(0)  加入收藏
阅读收获✔️1. 了解单点登录实现原理✔️2. 掌握快速使用xxl-sso接入单点登录功能一、早期的多系统登录解决方案 单系统登录解决方案的核心是cookie,cookie携带会话id在浏览器...【详细内容】
2021-12-23  程序yuan    Tags:单点登录(   点击:(8)  评论:(0)  加入收藏
下载Eclipse RCP IDE如果你电脑上还没有安装Eclipse,那么请到这里下载对应版本的软件进行安装。具体的安装步骤就不在这赘述了。创建第一个标准Eclipse RCP应用(总共分为六步)1...【详细内容】
2021-12-22  阿福ChrisYuan    Tags:RCP应用   点击:(7)  评论:(0)  加入收藏
今天想简单聊一聊 Token 的 Value Capture,就是币的价值问题。首先说明啊,这个话题包含的内容非常之光,Token 的经济学设计也可以包含诸多问题,所以几乎不可能把这个问题说的清...【详细内容】
2021-12-21  唐少华TSH    Tags:Token   点击:(10)  评论:(0)  加入收藏
实现效果:假如有10条数据,分组展示,默认在当前页面展示4个,点击换一批,从第5个开始继续展示,到最后一组,再重新返回到第一组 data() { return { qList: [], //处理后...【详细内容】
2021-12-17  Mason程    Tags:VUE   点击:(14)  评论:(0)  加入收藏
什么是性能调优?(what) 为什么需要性能调优?(why) 什么时候需要性能调优?(when) 什么地方需要性能调优?(where) 什么时候来进行性能调优?(who) 怎么样进行性能调优?(How) 硬件配...【详细内容】
2021-12-16  软件测试小p    Tags:性能调优   点击:(20)  评论:(0)  加入收藏
Tasker 是一款适用于 Android 设备的高级自动化应用,它可以通过脚本让重复性的操作自动运行,提高效率。 不知道从哪里听说的抖音 app 会导致 OLED 屏幕烧屏。于是就现学现卖,自...【详细内容】
2021-12-15  ITBang    Tags:抖音防烧屏   点击:(25)  评论:(0)  加入收藏
11 月 23 日,Rust Moderation Team(审核团队)在 GitHub 上发布了辞职公告,即刻生效。根据公告,审核团队集体辞职是为了抗议 Rust 核心团队(Core team)在执行社区行为准则和标准上...【详细内容】
2021-12-15  InfoQ    Tags:Rust   点击:(25)  评论:(0)  加入收藏
相关文章
    无相关信息
最新更新
栏目热门
栏目头条