厦大数据库实验室博客 | 总结、分享、收获

Redis安装和使用(Ubuntu系统)

本节内容包括Redis简介、安装Redis和Redis实例演示等，Redis在Window系统安装教程可参考https://dblab.xmu.edu.cn/blog/131/#more-131

Spark2.1.0入门：模型选择和超参数调整

【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
[返回Spark教程首页]

## 模型选择和超参数调整

在机器学习中非常重要的任务就是模型选择，或者使用数据来找到具体问题的最佳的模型和参数，这个过程也叫做调试（Tuning）。调试可以在独立的估计器中完成（如逻辑斯蒂回归），也可以在包含多样算法、特征工程和其他步骤的工作流中完成。用户应该一次性调优整个工作流，而不是独立的调整PipeLine中的每个组成部分。
继续阅读

使用Intellij Idea编写Spark应用程序（Scala+SBT）

点击这里观看厦门大学林子雨老师主讲《大数据技术原理与应用》授课视频
【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
返回Spark教程首页
对Scala代码进行打包编译时，可以采用Maven，也可以采用SBT，相对而言，业界更多使用SBT。之前有篇博客我们介绍了使用Intellij Idea编写Spark应用程序(Scala+Maven)，采用的是Maven工具。今天这篇博客同样是使用Intellij Idea编写Spark应用程序，但是使用的是SBT工具。下面开始我们的教程。
继续阅读

使用Eclipse编写Spark应用程序（Scala+SBT）

点击这里观看厦门大学林子雨老师主讲《大数据技术原理与应用》授课视频
【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
[返回Spark教程首页]

之前有篇博客介绍了使用Eclipse编写Spark应用程序，采用的是maven工具。今天这篇博客同样是使用Eclipse编写Spark应用程序，但是使用的是sbt工具。下面开始我们的教程。

继续阅读

Spark2.1.0入门：Spark GraphX 算法实例

【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
返回Spark教程首页
GraphX 中自带一系列图算法来简化分析任务。这些算法存在于org.apache.spark.graphx.lib包中，可以被Graph通过GraphOps直接访问。本章节主要介绍GraphX中主要的三个算法。
继续阅读

Spark2.1.0入门：Spark GraphX 图操作

【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
返回Spark教程首页
在介绍完Spark GraphX的属性图模型、简单的属性展示操作后，本章节介绍更多有关Spark GraphX的常用图操作。
继续阅读

Spark2.1.0入门：Spark GraphX 简介

【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
返回Spark教程首页

GraphX是Spark用来图和分布式图计算的新组件。GraphX通过引入属性图：顶点和边均有属性的有向多重图，来扩充Spark的RDD.为了支持这种图计算，GraphX 开发了一组基础功能操作。GraphX仍在不断扩充图算法，用来简化图计算的分析任务。
本章节主要介绍GraphX的核心抽象模型---属性图，并通过实例介绍如何构造一个图。
继续阅读