查看原文
其他

大数据可视化的途径:可视化并不是一个新的概念!

2017-12-09 飞马网 慧天地

点击图片上方蓝色字体“慧天地”即可订阅

(更多精彩请留意文末推)

人们预期数据可视化过程会继续发展,也许更多的是艺术和科学的混合,而不是数字计算技术。

看点01 显示结果

数据可视化是指以图形或图表格式通过人工或以其他方式组织和显示数据,以使受众能够:

更清楚地查看分析结果

简化正在使用的数据中的复杂性

了解并掌握正在使用的数据制作方法

看点02 可视化并不是一个新的概念

这种使用图片(排版、色彩、对比度和形状)来传达或理解数据的概念并不是新鲜事物,从17世纪的手工描绘地图和图形到十九世纪初发明的饼图都是这种形式。

如今,计算机可以用来快速处理大量的数据,使可视化更具价值。展望未来,人们可以预期数据可视化过程将会继续发展,也许更多的是一种艺术和科学的混合,而不是数字计算技术。

看点03 即时满足

数据可视化演进过程的一个令人兴奋的例子是,业界如何将数据可视化过程转移到生成和发布图表和图形的过程中,供观众进行审查和仔细考虑,从而设定了交互式可视化的期望。

通过交互式的可视化,人们可以更多地使用数据可视化的概念,进一步利用技术让观众与数据交互,为用户提供自助服务能力,以实时(或接近实时)交互式地深入到生成的图片、图表、图形(访问更多或特定的细节)来改变显示的数据(可能是不同的时间框架或事件)以及如何处理和/或呈现(可能选择条形图而不是饼图)。这使可视化更加有效和个性化。

人们可以通过使用数据驱动文档(D3)的典型网络浏览器在各种示例中介绍显示大数据分析结果的主题。D3允许将预先构建的数据可视化应用于数据集。

看点04 数据驱动的文件

数据驱动的文档在开放社区中被称为D3。D3是一个采用JavaScript编写的开源库。其目标是允许使用标准网页浏览技术(如HTML或CSS)轻松地处理基于数据的文档。它的附加值是为用户提供全面的功能,而无需自己构建或绑定到某个专用的框架中。

看点05 仪表板

正如前面所讨论的,事实上人们每天都在收集和积累大量数据,而组织出于各种原因依赖这些信息。

这些数据使用各种报告格式,包括数据仪表板。就像所有的事情一样,人们对于数据仪表板的定义有各种各样的担心。

通过仪表板可以演示解决方案的工作示例,而这样的示例基于使用Tableau的实时仪表盘格式,基于大数据分析有效呈现出结果。

Tableau的另一个目标是自助服务分析,用户可以通过对话选择数据来提问(实时模式而不是批处理模式)使用简单的点击分析直观地挖掘大数据,并有效地发现数据集或数据集中可能存在的理解和机会。

Tableau提供的一些令人兴奋的功能包括:

⊙实时拖放聚类分析

⊙交叉数据源加入

⊙强大的数据连接器

⊙移动启用

⊙实时的地区或区域数据探索

看点06 异常值

异常点是一个与数据中其他观测数据点相距甚远或极大不同的观测点。尽管异常值通常只表示大约1%到5%的数据,但当企业处理大数据时,调查甚至只是查看数据的1%到5%是相当困难的。

Python诞生于1989年,由Guido van Rossum创建,实际上Python的使用非常简单,但业界也认为其功能非常强大,速度快,可以在任何环境中运行。

根据定义描述,“开放源代码Python是世界各地许多公司和机构的生产力,软件质量和可维护性成功公式的一部分。”

业界对利用Python语言进行数据分析和大数据分析的兴趣日益浓厚,而且它是数据科学家日常工作的选择,因为它提供了一个库,实际上是一个标准库(甚至有些专注于大数据,如Pydoop和SciPy)来完成几乎所有人需要或想要处理的数据,包括:

⊙自动化

⊙建立网站和网页

⊙访问和操作数据

⊙计算统计

⊙创建可视化

⊙报告

⊙建立预测和解释模型

⊙评估额外数据的模型

⊙将模型整合到生产系统中

最后要说明的是,Python的标准库非常广泛,提供了一系列内置模块来提供对系统功能的访问,以及标准化的解决方案来解决日常编程中出现的许多问题,这是探索处理大数据离群值和相关处理的一个明显选择。



看点07 操作智能

操作智能(OI)是一种分析方法,试图通过(通常是机器生成的)操作或事件数据来提供可视性和洞察力,实时运行针对数据流馈送的查询,产生作为操作指令的分析结果,可以通过人工或自动操作(将数据集转化为价值的明确例子)让组织立即执行。

Splunk软件是帮助实现隐藏的价值在机器生成的一个很好的工具,使用Splunk,企业可以在一个地方收集、索引、搜索、分析,以及可视化所有数据,从几乎任何地方提供一种整合方法,可以从大量机器数据中组织和提取实时信息。

Splunk将数据存储在文件中,为文件分配索引。 Splunk不需要在后台运行任何数据库软件来实现此目的。Splunk调用这些文件索引器。Splunk可以对任何类型的时间序列数据(具有时间戳的数据)进行索引,使其成为大数据操作智能(OI)解决方案的最佳选择。在数据索引期间,Splunk会根据其标识的时间戳将数据分解为事件。

来源:飞马网 (版权归原作者及刊载媒体所有)

荐读

点击下文标题即可阅读

关于加快推进智慧城市时空大数据与云平台建设试点工作的通知

中国工程程院院士高文:从大数据科学到人工智能的迁移过程

大数据时代如何寻找地理可视化的引爆点

39个大数据可视化工具

编辑 / 杨志如     审核 / 焦月    荐稿 / 李秀娟

指导:万剑华教授(微信号wjh18266613129)

您可能也对以下帖子感兴趣

文章有问题?点此查看未经处理的缓存