其他

Spark入门：Word2Vec

Word2Vec 是一种著名的 词嵌入（Word Embedding） 方法，它可以计算每个单词在其给定语料库环境下的 分布式词向量（Distributed Representation，亦直接被称为词向量）。词向量表示可以在一定程度上刻画每个单词的语义。
继续阅读

聚类（Clustering） 是机器学习中一类重要的方法。其主要思想使用样本的不同特征属性，根据某一给定的相似度度量方式（如欧式距离）找到相似的样本，并根据距离将样本划分成不同的组。聚类属于典型的无监督学习（Unsupervised Learning） 方法。与监督学习（如分类器）相比¹，无监督学习的训练集没有人为标注的结果。在非监督式学习中，数据并不被特别标识，学习模型是为了推断出数据的一些内在结构。
继续阅读

Spark入门：协同过滤算法

[返回Spark教程首页]

一、方法简介

协同过滤是一种基于一组兴趣相同的用户或项目进行的推荐，它根据邻居用户(与目标用户兴趣相似的用户)的偏好信息产生对目标用户的推荐列表。
继续阅读

Spark入门：决策树分类器

【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
[返回Spark教程首页]

一、方法简介

决策树（decision tree）是一种基本的分类与回归方法，这里主要介绍用于分类的决策树。决策树模式呈树形结构，其中每个内部节点表示一个属性上的测试，每个分支代表一个测试输出，每个叶节点代表一种类别。学习时利用训练数据，根据损失函数最小化的原则建立决策树模型；预测时，对新的数据，利用决策树模型进行分类。
继续阅读

Spark入门：逻辑斯蒂回归分类器

[返回Spark教程首页]

方法简介

逻辑斯蒂回归（logistic regression）是统计学习中的经典分类方法，属于对数线性模型。logistic回归的因变量可以是二分类的，也可以是多分类的。
继续阅读

Spark入门：主成分分析（PCA）

【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
[返回Spark教程首页]

继续阅读

Spark入门：奇异值分解（SVD）

【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
[返回Spark教程首页]

继续阅读

Spark入门：支持向量机SVM分类器

【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
[返回Spark教程首页]

方法简介

支持向量机SVM是一种二分类模型。它的基本模型是定义在特征空间上的间隔最大的线性分类器。支持向量机学习方法包含3种模型：线性可分支持向量机、线性支持向量机及非线性支持向量机。当训练数据线性可分时，通过硬间隔最大化，学习一个线性的分类器，即线性可分支持向量机；当训练数据近似线性可分时，通过软间隔最大化，也学习一个线性的分类器，即线性支持向量机；当训练数据线性不可分时，通过使用核技巧及软间隔最大化，学习非线性支持向量机。线性支持向量机支持L1和L2的正则化变型。关于正则化，可以参见http://spark.apache.org/docs/1.6.2/mllib-linear-methods.html#regularizers
继续阅读

Spark入门：特征抽取：CountVectorizer — spark.ml

【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
[返回Spark教程首页]

继续阅读

Spark入门：特征抽取： TF-IDF — spark.ml

【版权声明】博客内容由厦门大学数据库实验室拥有版权，未经允许，请勿转载！
[返回Spark教程首页]

继续阅读

厦大数据库实验室博客

其他

Spark入门：Word2Vec

Spark入门：KMeans聚类算法

Spark入门：协同过滤算法

一、方法简介

Spark入门：决策树分类器

一、方法简介

Spark入门：逻辑斯蒂回归分类器

方法简介

Spark入门：主成分分析（PCA）

Spark入门：奇异值分解（SVD）

Spark入门：支持向量机SVM分类器

方法简介

Spark入门：特征抽取：CountVectorizer — spark.ml

Spark入门：特征抽取： TF-IDF — spark.ml