《异常检测算法 --Isolation Forest》

时间：2020-06-30 09:20:18 阅读：78 评论：0 收藏：0 [点我收藏+]

异常检测算法 --Isolation Forest

　　南大周志华老师在 2010 年提出一个异常检测算法 Isolation Forest，在工业界很实用，算法效果好，时间效率高，能有效处理高维数据和海量数据，这里对这个算法进行简要总结。

iTree

　　提到森林，自然少不了树，毕竟森林都是由树构成的，看 Isolation Forest（简称 iForest）前，我们先来看看 Isolation Tree（简称 iTree）是怎么构成的，iTree 是一种随机二叉树，每个节点要么有两个女儿，要么就是叶子节点，一个孩子都没有。给定一堆数据集 D，这里 D 的所有属性都是连续型的变量，iTree 的构成过程如下：

　　随机选择一个属性 Attr；
　　随机选择该属性的一个值 Value；
　　根据 Attr 对每条记录进行分类，把 Attr 小于 Value 的记录放在左女儿，把大于等于 Value 的记录放在右孩子；
　　然后递归的构造左女儿和右女儿，直到满足以下条件：
　　　　传入的数据集只有一条记录或者多条一样的记录；
　　　　树的高度达到了限定高度；

　　iTree 构建好了后，就可以对数据进行预测啦，预测的过程就是把测试记录在 iTree 上走一下，看测试记录落在哪个叶子节点。iTree 能有效检测异常的假设是：异常点一般都是非常稀有的，在 iTree 中会很快被划分到叶子节点，因此可以用叶子节点到根节点的路径 h(x) 长度来判断一条记录 x 是否是异常点；对于一个包含 n 条记录的数据集，其构造的树的高度最小值为 log(n)，最大值为 n-1，论文提到说用 log(n) 和 n-1 归一化不能保证有界和不方便比较，用一个稍微复杂一点的归一化公式：

?? (??, ??) = 2 (- ? ( ?? ) ?? ( ?? ) )

?? (??) = 2 ?? (?? - 1) - (2 (?? - 1) / ??), 其 中 ?? (??) = ?? ?? (??) + ?? ，

　　随机选属性，随机选属性值，一棵树这么随便搞肯定是不靠谱，但是把多棵树结合起来就变强大了；

iForest

　　iTree 搞明白了，我们现在来看看 iForest 是怎么构造的，给定一个包含 n 条记录的数据集 D，如何构造一个 iForest。iForest 和 Random Forest 的方法有些类似，都是随机采样一一部分数据集去构造每一棵树，保证不同树之间的差异性，不过 iForest 与 RF 不同，采样的数据量