信宜玉都风情网

开启左侧

HR流程图

[复制链接]
依然 发表于 2012-1-18 16:44 | 显示全部楼层 |阅读模式

信宜-玉都风情网欢迎您的到来,注册后,您将能玩到更多好玩的功能!信宜人的网上家园,网聚信宜人的力量。

您需要 登录 才可以下载或查看,没有账号?注册会员

x
HR流程图
项 目
作业流程
作业说明/控制要点
支持图表
责任单位/负责人
督导责任人
人力 需求
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image11.png
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image47.png
1、各部门根据公司生产与业务需求,制定部门人员需求表                                               2、行政根据公司总体经营目标和要求,制定人员的规模及规划
人员资源需求表
人力需求部门
G/M部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image22.png
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image12.png
人员资源合理安排表
人力资源部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image23.png
招聘 计划
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image1.png
1、明确每个职位的工作性质及任职条件进行汇总
人员明细汇总表
人力资源部
G/M部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image24.png
2、明确通过哪些渠道与方法进行人才招聘
职务说明书
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image3.png
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image46.png
招聘渠道:刊登招聘广告、网上招聘、人才市场招聘、介绍所、员工内部推荐及其它招聘渠道。
工作岗位职责
人力资源部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image25.png
人才计划招聘书
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image13.png
3、报经总经理审核与批准
G/M部
人员 招聘
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image26.png
1、严格按照人员岗位聘用原则来进行人员招聘
人员岗位聘用原则书
人力资源部/相关部门
G/M部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image10.pngfile:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image44.pngfile:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image45.png
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image43.png
2、人力资源部对应聘人员进行全面科学的考评,明确用人标准,择优录用,宁缺毋滥,初试通过再进行再一部分的复试
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image6.png
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image27.png
相关人员技术标准书
人力资源部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image8.png
3、相关部门主管根据所需岗位需具备的专业技术能力进行复试考核部分
相关部门主管
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image7.png
具体岗位录用表
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image28.png
4、要求技术含量较高的人员将由公司上级进行复试
G/M部
5、行政人员给新进员工办理相关的入职手续(员工个人档案、厂牌、食膳、住宿)及为员工讲解大致上的员工需知
员工手册书
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image2.png
人力资源部
试用
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image14.png
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image29.png
1、行政部门及相关的部门人员对新进员工在试用阶段进行跟踪与评定.
新进员工跟踪评定表
人力资源部/相关部门
G/M部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image31.png
2、为了提高新进员工素质和技能,对新进员工进行职前培训(具体包括企业文化、各项规章制度、公司材料及产品的认识、了解公司的发展史等)
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image9.png
企业文化及各项规章制度资料
人力资源部/相关讲师
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image30.png
聘用
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image15.png
1、试用期1-3个月,公司根据员工的学习适应能力与 工作态度予以转正
员工转正单
该部门主管
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image32.png
G/M部
绩效 考核
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image16.png
部门主管本着公平,公开,公正对该部门的每一位员工进行每月一次的绩效总结。
绩效考核表
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image34.png
人力资源部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image33.png
对员工进行更加深入的培训——消防安全知识的培训、自检能力的训练、材质及产品的深入认识,相关人员机台的知悉。
消防安全培训记录表
相关讲师
G/M部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image35.png
建立 档案
对公司正式聘用的员工要进行档案进行完善(包括个人薪资表、奖罚公布单、人员异动单、员工转正单、劳动合同、培训试卷/成绩、暂住证、人员考核表、参加保险事项及其他相关档案)
个人薪资表
人事助理
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image18.png
奖罚公布单
人事主管
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image36.png
员工异动单
劳动合同
G/M部
人员 离职
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image17.png
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image37.png
员工离职原因:
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image19.png
辞职:员工因个人原因辞去工作,辞职员工需提前1个月向公司提出辞职请求,定于每月的10日或25日提送;辞退:员工不能胜任其工作岗位;开除:严重违反公司规章制度或有违法犯罪行为;自离:无故旷工3天视为自离
辞职申请表
人事
人力资源部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image42.png
辞退书
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image38.png
自离单
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image21.png
审批
上级领导根据相关部门主管反馈上来的员工表现单来决定是否批准该员工的离职申请,对于绩效较好的员工努力劝导给予挽留,对于绩效一般人员给予批准。
员工表现单
相关部门主管
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image39.png
人力资源部
G/M部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image20.png
G/M部
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image40.png
离职人员的工作职责相关主管将安排其他人员接替
离开 公司
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image4.png
辞职人员办理完交接手续后携带辞职书及一份《工作移交清单》到人力资源部办理相关手续。具体包括:厂服、厂牌、宿舍钥匙及工具文具的交还,劳动合同的解除。
工作移交清单
人事助理/总务
人事主管
劳动合同解除单
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image41.png
file:///C:\DOCUME~1\ADMINI~1\LOCALS~1\Temp\ksohtml\clip_image5.png
员工办理完相关离职手续后打包好自己的行李到人事开一张出厂证明单(携物者、同室友、人事总务的签名)交由保安,方可离厂。
出厂证明单
总务
批   准                                                                                                                                                               编  制   

www06681com
我心飞翔 发表于 2012-1-18 17:04 | 显示全部楼层
无识睇~~~~~~~~~
www06681com
回复 支持 反对

使用道具 举报

 楼主| 依然 发表于 2012-1-18 17:11 | 显示全部楼层
       

本科毕业设计(论文)                             
BP神经网络的异常点检测应用可行性研究
       
       
        学    院       计算机学院        
        专    业                   软件工程         
        年级班别       2006级(4)班   
        学    号       3106007039        
        学生姓名        蔡东赟           
        指导教师        王丽娟           


2010年 5 月
摘  要

        异常点数据是指数据集中与众不同数据。这部分数据的量小,但是对于我们的日常生产生活的影响极大。因此,异常点检测被广泛应用于网络入侵检测,金融保险,天气预报以及新药研制等领域。相对于大量的正常数据挖掘而言,异常点检测被称作小模式数据挖掘。BP算法是一种常用的数据挖掘算法。但是BP算法进行实际数据的异常点数据挖掘过程中存在:实际数据的维数较高,存在冗余特征的干扰,以及在高维特征下,数据量不充分的问题。因此,本文分析BP神经网络处理各种数据的情况,并得到以下结果。(1)BP神经网络能够较好的分离特征单一的仿真数据;但是(2)特征相似性较大的数据集,难以分离判断;(3)正常数据不充分或者不具有代表性,因此正常数据类学习不充分,从而导致异常无法判断。针对以上问题,本文提出了以下的改进措施:(1)BP算法前进行特征约简(映射)从中选取有益于异常检测的特征(2)多神经网络融合,不同神经网络识别不同的特征,相互取长补短,融合后得到最终的结果。



        关键字:异常,BP,异常点检测,神经网络
       
       
       
       
       
       
注:本设计(论文)题目来源于教师的国家级(或部级、省级、厅级、市级、校级、企业)科研项目,项目编号为:          。
       
Abstract

        Outlier data is the data set different data. This part of the small amount of data, but for our daily production and life of great. Therefore, the anomaly detection is widely used in network intrusion detection, finance, insurance, weather, and new drug development and other fields. Relative to the large number of normal data mining, the anomaly detection model is called data mining small. BP algorithm is a commonly used data mining algorithm. But the BP algorithm to real data outliers exist in the data mining process: the higher the dimension of the actual data, there are redundant features of the interference, and high-dimensional feature, the issue of inadequate data. Therefore, this paper analyzes a variety of BP neural network processing of data, and to get the following results. (1) BP neural network can better separation characteristics of a single simulation data; but (2) the characteristics of similar large data sets, separation is difficult to judge; (3) normal data is not sufficient or not representative, so the normal data class learning is not sufficient, leading to abnormal can not judge. To solve the above problem, this paper proposes the following improvements: (1) BP algorithm before feature reduction (map) benefit from anomaly detection features selected (2) integration of multiple neural networks, different neural network to recognize the different characteristics of each each other, the final fusion result.
       
       
       

        Key Words:Outliers-Data,BP,Algorithms,Neural Networks
目  录
1引言        1
1.1背景        1
1.2        传统已有异常点算法介绍        1
        1.2.1基于统计学的异常点检测算法        1
        1.2.2基于距离的异常点检测算法        2
        1.2.3基于密度的算法        3
        1.2.4基于偏差的异常点检测        5
        1.2.5基于聚类的异常点检测算法        6
2基于属性特征在异常点检测中的研究        7
3 BP神经网络介绍        9
3.1模型简介        9
3.2计算各层节点输出        9
3.3 修正权值        10
4 异常检测中BP神经网络的设计        13
4.1可微阈值单元        13
4.2单个BP网络结构设计        13
4.3BP神经网络学习过程的基本步骤        14
5实验研究        17
5.1研究使用的数据库介绍        17
5.2训练方案一实验:把bp神经网络相似性代替距离算法相似度量        17
5.3训练方案二实验:用单个神经网络对训练数据库整体特性进行学习        18
5.4训练方案三实验:多神经网络各种形式训练及其决策        19
5.4.1实验设计思路        19
5.4.2实验方案及步骤        20
5.4.3实验分析        22
5.4.4实验失败原因分析        23
5.5BP调参实验        25
5.5.1对实验一调整隐层实验        25
5.5.2对实验二调整隐层实验        26
5.5.3对实验三调整隐层实验        29
5.6数据仿真实验        31
5.6.1实验思路        31
5.6.2实验步骤        31
5.6.3实验结果        32
5.6.4结果分析        33
5.7实验整体分析        33
总结与展望        35
致谢        39













1引言
1.1背景

        异常点(离群点或者孤立点)检测是数据挖掘中一个重要方面,Hawkins[1]最早给出了异常点的本质定义:异常点是数据集中与众不同地数据,以至于使人怀疑这些数据并非随机偏差,而是产生与完全不同的机制。异常点可能由于度量或执行错误产生,也可能是由于固有数据可变性的结果。例如,一个公司首席执行官的工资自然远远高于公司其他雇员的工资,成为一个异常点。许多数据挖掘算法试图减少异常点的对挖掘结果的影响,或者在挖掘过程中排除异常点。然而异常点可能隐藏着重要的信息,也许比一般的数据更有价值。因此人们开始逐渐研究异常点挖掘算法。目前异常点检测已经开始用于信用卡欺诈、网络入侵检测以及金融申请和交易欺诈等领域[2],近年来异常点检测已成为数据挖掘研究中的一个热点问题。
        传统数据挖掘主要有以下几类:基于统计的方法,基于距离的方法,基于偏移方法,基于聚类方法,基于密度方法。本文从特征与异常检测的关系出发进行研究。BP神经网络适用于储存和描述这种复杂的关系。但是异常检测过程,通常数据的位数较高,在高维特征存在冗余特征干扰,以及高维特征下数据不充分的问题,因此,本文研究了BP神经网络应用于不同情况。
1.2        传统已有异常点算法介绍
1.2.1基于统计学的异常点检测算法
       
        早期的异常点检测算法大多数是基于统计学实现的,通常可以分为基于分布的检测算法和基于深度的检测算法两类。前者一般通过先构造一个标准概率分布来拟合数据集,然后根据概率分布来确定异常点,例如Rosner提出的单样本多个异常检测算法ESD算法,和Yamnishi等使用混合高斯模型的异常点检测算法。此类算法估计多维分布的概率模型的难度较大,且准确性低。基于深度方法主要以计算几何为基础,通过计算不同层的K-D凸包将外层的对象判定为异常点。但当数据集较大,此类方法在维数上的伸缩性不好。
        基于统计的异常点检测方法易于理解,实现方便,但此方法检测出来的异常点很可能被不同的分布模型检测出来,解释异常点意义时经常发生多义性。其次,此方法在很大程度上依赖于待挖掘的数据集是否满足某种概率分布模型、模型的参数、异常点的数目等对基于统计的方法都有非常重要的意义,而确定这些参数通常比较困难;另外,此方法大多适合于挖掘单变量的数值型数据,然而许多数据挖掘问题要求在多维空间中发现异常点,目前几乎没有多元的不一致检验,当没有特定的检验时,或观察到的分布不能恰当地用任何标准的分布建模时,此类方法不能确保所有的异常点被发现。

1.2.2基于距离的异常点检测算法

        基于距离的异常点检测算法的基本思想是把数据点看作空间中的点,异常点被定义为与大多数数据距离较远的点。通常这类异常被描述为。当且仅当数据集中至少有个数据点与点的距离大于时,数据对象点称为异常点。这类方法与基于密度的检测算法有很大的相似之处,不需要事先知道数据集的分布模型,对于任意分布模型均有效。
        基于距离方法最早是由Knorr和Ng在1998年提出的。他们用DB(p,d)来表示数据集中的异常点,采用不同的参数与,可以表示所有的异常点。与此 定 义 相应的算法有三种,它们是基于索引(Index-based)的算法,嵌套循环(Nest-Loop,NL)算法,基于单元或划分(cell-based)的算法等。基于索引的方法依赖多维索引结构(R-trees,X -trees,KD -tress等)的性能。随着维数的增加,所有的索引结构的性能迅速下降,使得算法性能不佳。NL算法可以避免构建索引结构,减少了算法的次数。以上两方法的算法时间复杂度为,当遇到大量数据集时它们还有待改进。基于单元的方法是把数据集划分为单元,逐个单元的检测,而非逐个对象的检测。它的时间复杂度为,其中取决于单元的个数和维数。 Knorr和Ng通过试验证明,当时此算法优于NL算法。
        相对前两者,基于单元的算法无论是在数据量还是在维数增加时,性能都是最好的。此算法需要将数据空间分隔成彼此独立的单元结构,经过多次选择来判断离群数据。对于参数的每个变化都需要调整单元结构,因此会影响了算法的结果。后来,Rastogi和Ramaswamy提出了一个新的基于距离的异常点定义,即基于距离的第最近邻(k-th Nearest Neighbor)异常点挖掘方法。给定维空间中包含个点的数据集、参数和 (自然数),表示点和它的第最近邻的距离。如果满足的点q不超过n-1个,即,那么称为异常点。如果对数据对象根据它们的距离进行排序,那么前n个点就被看作异常点。他们用聚类算法首先对数据集进行聚类,然后在类中发现异常点。相对于异常点挖掘,异常点挖掘方法人为干预的因素要小一些。但它也有自身缺陷,就是要计算数据集中所有点的,这显然影响到算法的效率。对低维空间的数据此方法优于索引算法和NL算法,但对于高维数据此算法性能不高。
        Bay和Sc hwabacher在沿用Rastogi和Ramaswamy对于异常定义的基础上,提出了一种基于随机抽样的检测方法,它通过随机抽样的方法,减少了寻找k近邻的范围,在试验数据上获得了几乎线性的计算复杂度。
        随着人们对基于距离的方法的不断研究,一些新的、较好的算法也不断的涌现。代表性的算法有: 陆声链等提出一个判断异常点的新定义,并设计基于抽样近似检测算法。使得算法性能有所提高;另外,徐雪松等利用聚类算法与第k个最近邻的原理提出了基于距离的再聚类的异常点算法,它克服一些基于距离算法的缺点,并取得较好的试验结果。
        与基于统计的方法相比,它有以下几个优点: 则可找出数据集中的异常点。
        (1) 在理论上可以处理任意维任意类型的数据,这就克服了基于统计方法仅能检测单个属性的缺点。
        (2) 不必对数据集的相关信息(数据服从哪种统计分布模型,数据类型特点等)足够了解。实际上在给出了距离的度量,并对数据进行预处理后。
       
1.2.3基于密度的算法
       
        基于密度方法是在基于距离的方法上改进而来。基于密度的异常观点比基于距离的异常观点更贴近Hawkins的异常定义,因此能够检测出基于距离异常算法所不能识别的局部异常。局部异常观点摒弃了以前所有的异常定义中非此即彼的绝对异常观念,更加符合现实生活的中的应用。
        所谓密度是基于任意一点和P点距离小于给定半径R的邻域空间内的数据点的个数计算得到的。一般的对密度的定义是点到其量近邻的平均距离,平均距离小则密度小。基于密度的异常点检测,就是探测局部密度,通过不同的密度估计策略来检测异常点。代表性算法主要有以下几种。
        Brito等提出相互k近邻图(Mutual k—Nearest Neighbor,简称MkNN)算法,其主要思想是对每个连通子图进行检测,如果包含多个结点就组成一个簇,如果仅有一个结点,那么该结点就是异常点。该算法针对数据点的分布对各种特殊形状都有效,但算法执行效率不高。
        (2)Ville Hautamaki等提出两种基于密度的异常点检测算法,第一种算法思路为在kNN图中,若顶点u成为其它点的k近邻的次数少于给定阈值T时就被认为是异常点,另一种算法则是先对所有顶点的平均k近邻距离进行排序,然后将平均k近邻距离大于T点顶点视为异常点。
         (3)Papadimitriou定义了多粒度偏离系数(Multi—Granularity Deviation Factor,简称MDEF),该算法将多粒度偏离系数是所在邻域的标准多粒度偏离系数的3倍的点判定为异常点,然而标准多粒度偏离系数的计算量大,对算法的可行性有一定的限制。
        (4)Dongmei Ren等采用相对密度系数(Rela—tive Density Factor,简称RDF),即P点的密度相对该点的邻域密度的比值作为孤立程度的度量方法,其基本思路是首先基于RDF对位于簇中心的数据点进行剪枝,然后仅仅在剩下的较小的数据集中进行异常点检测。该方法降低了数据集的大小,提高了算法效率,但是在剪枝过程中对于特殊分布的数据集就有可能将异常点剪掉,算法的准确性受到限制。
        (5)Breuning 提出了局部异常的概念及相应异常检测方法(DBOM算法),即数据集中的每个对象的异常程度用局部异常因子LOF来衡量。也就是说是否是异常点不仅仅取决于它与周围数据的距离大小,而且与邻域内的密度情况有关。一个对象领域内的密度可以用包含固定结点个数的域半径指定半径领域中包含的结点数来描述。这样就不会像DB(p,d)异常点那样遗漏一部分异常点。LOF算法充分体现了“局部”的概念,每个点都给出了一个离群程度,离群程度最强的那个几个点被标记为异常点。文献有关发面对LOF进行推广:一是由原来的一个邻域的变化为两个(计算密度领域和比较密度领域);二是剪除非异常对象来减小计算代价;因此,使用算法比传统的LOF算法有所提高。
        在现有的计算局部异常因子(LOF)算法中,把具有很高LOF值的对象作为异常点。计算LOF要耗费很大的计算量,针对此问题malik Agyemang提出了修改算法,即局部稀疏系数(LSC)算法。这种方法主要是引入局部稀疏系数(LSC)这一概念,根据每个对象的LSC值按从大到小的顺序排列整个数据集并把前n个对象作为异常点。
        但是,此方法在实际应用中计算量亦是不小,效率有待提高。
        另外,岳峰等利用反向K近邻(RKNN)这个概念提出了一个异常点检测算法(ODRKNN),在综合数据集和正式数据集上的实验结构表明,该算法能有效地检测出异常点,且算法效率高于典型的基于密度的异常点检测算法LOF和LSC的效率。

1.2.4基于偏差的异常点检测
       
        基于偏差的异常点检测不使用统计检验或者基于距离的度量来识别异常对象。相反,它通过检查一组对象的主要特征来识别异常点。背离这种描述的对象认为是异常点。因此,在该方法中,属于偏差通常用于指异常点。主要有两种技术:第一种顺序地比较集合中的对象,叫顺序异常技术(sequential exception technique);第二种采用OLAP数据立方体方法识别大型多维数据中的异常区域。
        (1) 序列异常技术:Aming和Argrawal 提出一种序列异常(sequential exception)的概念。这个算法复杂度与数据集大小呈线性关系,有优异的计算性能。但是并没有得到普遍的认同,这是因为序列异常在概念上有一定的缺陷,它对异常点存在的假设太过理想化,对现实复杂数据效果不太好。
        (2) OLAP数据立方体技术:在大规模的多维数据中采用数据立方体来确定反常区域.如果一个立方体的单元值显著地不同于根据统计模型得到的值,该单元被认为是一个异常。此方法是发现驱动探索的一种形式。此方法由于搜索空间很大,人工探测非常困难。
        第一种概念有缺陷,遗漏了不少异常点,时间复杂度与数据集大小成线性关系,适用性不高。第二种搜索空间大,人工探测困难,效率不高,只适用多维数据。

1.2.5基于聚类的异常点检测算法

        在聚类算法中,异常点检测仅仅是聚类的副产品。聚类算法发展方向是优化聚类过程,而不是提高对异常点检测的能力,异常点检测和聚类是两个相对立的过程,聚类是把属于统一类的数据点聚集在一起,归为一类,而异常点检测是把和大多数数据点相异的点挖掘出来。
        Su等人首先提出基于聚类的异常点检测算法,聚集的较小簇被认为是异常点,但这中方法忽略了小聚集簇和大聚集簇之间的距离,当一个小聚集簇和一个大聚集簇非常接近的时候,小聚集簇中的这些点更可能是大聚集簇的边界点而不是异常点。
        模糊k均值聚类算法(FCM)常用于异常点检测,该算法动态地分配权重给每一个数据点,权重表示该数据点和数据集中心之间的距离,通过各点的权重来判断异常点。此类算法没有先验知识指导如何确定聚类中心,只能是随机选取,优化搜索空间较大,算法的复杂度较大。
        Hongyi Zhang等引为了提高模糊核聚类算法的运行效率,提出了新的模糊核聚类算法,该算法用先验知识对参数初始化。取代了用聚类中心初始化,改进了聚类的目标函数,降低了算法的时间复杂度,但该算法没有提到如何选取核函数,对于算法模糊性的控制不好撑握。

2基于属性特征在异常点检测中的研究

        传统算法大都是通过数据在空间地特性来判断检测异常点。本文的方向是从特征出发研究。传统算法从整个数据集合在空间中分布地特性出发研究,比如距离的从整个数据集空间距离进行研究,同样密度的按数据集空间密度研究,聚类也是按数据集空间特性。而本文直接从已知部分数据维度的特征着手,即是直接从每一组数据的特征来研究。
        对于单属性特征的情况,根据数据重要性调整特征(即维度)权值,并根据数据重要性调整。假设数据特征表示在每个属性上面,独立没有组合属性表现特征地情况下,每一组数据属性对应权值数据乘积和,表示这个数据在这组数据中全局中所占的重要性。例如检测是否是糖尿病人的数据库,三十岁以下这个年龄维度上病人较少,然而五十岁后这个维度病人比例就多了。映射到维度为三十岁以下这个维度地病人比较少,映射到维度为十岁以上较多。这样我们可以添加一个权值与年龄这一项数据乘积,这个乘积必须使权值与当前数据乘积出来的数据成正比,表示年龄增长能够体现在这组数据中的重要性。以便全局统筹决策较容易。设X为一组数据集合,可使趋向某个数值,表示这组数据某个总体特征。异常或者非异常,可以通过趋向某个数值表示特征异常,另一个方向数值表示非异常。
        有时候数据组合的重要性是体现在几个数据地组合里面,既可能体现在几个属性上面,比如说一组数组(A,B,C),可能AB组合特征不显示异常,然而ABC组合就显示异常,这些组合是不定地。所有在属性权值之上需要一组对属性不同组合特征的权值调整。
       
图2.1 样例图示
       
        如图2.1,某个异常点可能异常特征是属性1,可能是属性1、属性2地组合,对于同个数据库不同点具有组合不确定性。
        由于特征地不可确定性,数值不确定,组合不确定。我们可以采用神经网络自学习调整权值。同时根据已知数据训练修改这些权值,使其具有识别某种组合特征的能力。使其自学习特征,自动控制调整权值及权值组合。
        人工神经网络作为一种新型信息处理系统,在信息处理方面,具有如下显著的特点:
        (1)输入-输出映射能力。人工神经网络具有自学习能力,通过学习,能够根据网络期望输出和网络实际输出之差来调整神经元间连接权值和阈值,直至使实际输出与期望输出之间的误差减小到满意的程度,这样就实现了输入到输出的映射。人工神经网络的输入-输出映射能力对于预测有特别重要的意义。
        (2)非线性特性。人工神经网络具有很强的非线性,这种非线性分散在每个神经元,通过传递函数实现。利用神经网络的非线性特性,可解决药学研究及实验数据处理过程中大量的非线性问题。
        (3)高度并行性。人工神经网络是由许多相同的简单处理单元并联组合而成,具有高度并行性特性,使其对特定任务的计算变得很快,对信息的处理能力与效果惊人,因此提供了一种解决高层复杂问题的能力和方法。
        (4)良好的容错性与联想记忆功能。人工神经网络通过自身的网络结构能够实现对信息的记忆,而所记忆的信息是存储在神经元之间的权值中。从单个权值中看不出所存储的信息内容,因而是分布式的存储方式,这使得网络具有良好的容错性,既能进行模式信息处理工作,又能进行模式识别工作。
        因为这些特点,神经网络广泛应用在聚类分析、模式识别、信号处理、系统辨识、优化计算、预测控制等领域。
        根据神经网络记忆分类地特性,本文设想通过这些特性学习出能够辨别异常点非异常点数据的神经网络,主要研究其可行性。
       
3 BP神经网络介绍
3.1模型简介       

        人工神经网络理论是80年代中后期迅速发展起来的一项前沿研究领域,其应用已渗透到各个领域。BP神经网络模型是人工神经网络的重要模型之一,应用尤为广泛。
        BP算法主要包括两个过程,一是由学习样本、网络权值从输入层→隐含层→输出层逐次算出各层节点的输出;二是反过来由计算输出与实际输出偏差构出的误差函数E(),用梯度下降法调节网络权值,即
                                                                       (3.1)
        使误差减小。
        设输入层节点数为n,隐含层节点数为r,输出层节点数为m,隐含层与输入层之间的权值矩阵为,隐含层节点阀值为,输出层与隐含层之间权值矩阵为,输出层节点阀值为,并设有N个学习样本其中为第P个学习样本的输入向量,为其实际输出向量。其中,下文中如不指明则相同。
       
3.2计算各层节点输出
输入层节点,取其输出与输入相同,即
隐含层节点输入,输出分别为:
                                                                                                          (3.2)
若令则有:
,
。
输出层节点输入,输出分别为:
                                                                           (3.3)       
若令,则有:
                                  (3.4)
3.3 修正权值
设               
其中为第p个学习样本产生的输出误差,为总误差。
由误差函数调整权值有:
                  
其中              
                    
其中               
                          
                                                                                    (3.5)
其中为学习速率,一般在[0,1]内取值。
权值修正为:
                                                                                                               (3.6)
                                                                                                   (3.7)

4 异常检测中BP神经网络的设计
4.1可微阈值单元

       
       
       
       
       
       
       
       
        图 4.1可微阈值单元
       
        如图 4.1 可微阈值单元,图中为sigmoid单元,与感知器相似,sigmoid单元先计算它的线性组合,然后应用一个阈值到此结果。然而,对sigmoid单元,阈值输出是输入的连续函数。更精确地讲,sigmoid单元这样计算输出。
                                                             (4.1)
        其中:
                                                                                          (4.2)
        经常被称为sigmoid函数或者也可以称为logistic函数。注意它的输出范围为0到1,随输入单调递增。因为这个函数把非常大的书值域映射到一个小范围的输出。也叫挤压函数。
        本算法就是想把所有整数据特征映射到一个小范围来处理判断。

4.2单个BP网络结构设计
       
        采用4.1为神经感知器,隐层感知器根据实际数据库的属性确定,一般少于等于属性个数,输出层一个输出感知器。
       
       
       
        图 4.2 BP结构
       
        输入层为一组数据,全连接到隐层,隐层计算输出受挤压函数处理后的数值,输出层的输入为隐层输出。最后输出0到1的数值。
        隐层输出层的神经元,每个的都初始化为-0.05,其他权值都初始化:(double) ((rand()/32767.0)*2-1);随机数种子为系统时间。
        训练教师信号,按具体方案处理设定。
       
4.3BP神经网络学习过程的基本步骤
       
        (1)定义误差函数为期望输出与实际输出之差的平方和:
                                                         (4.3)
        其中yj是输出单元的期望输出,是实际的输出。
        (2)调节权值的公式为:
                                                          (4.4)
        其中为学习步长,取正参数,代表上一层神经元的输出,而有两种情况:
        1) 如果j是输出层(第m层)的神经元,则
                                                    (4.5)
        2) 如果j不在输出层,而是隐含层的神经元,则
                                                    (4.6)
        是该神经元的输出,而求本层的必须用到上一层的,可见误差函数的求取是一个始于输出层的反向传播的递归过程。
        (3)将学习模式不断输入到输入层,再根据输出层产生的误差不断修正神经元间连结的权值和神经元的阈值,直到学习模式全部输入或误差达到一定的值。
        反向传播算法在网络规模较大时计算量很大,收敛较慢,而且存在局部最小的问题,根据这一问题,在具体操作时采用了加入动量项的方法:
                                          (4.7)
        称为动量因子,这样后一次的权值更新适当考虑上一次的权值更新,可以改善收敛特性。
5实验研究
5.1研究使用的数据库介绍
       
        在尝试各种算法方案地研究中,使用的数据库名称:The Insurance Company Benchmark (COIL 2000).关于保险的数据,其中包括:TICDATA2000.txt,训练数据,5822组数据,每组86个属性,第86个为是否异常的标志变量,总地为两类数据;TICEVAL2000,测试数据,4000组,每组为85个特征属性;TICTGTS2000.txt,与ticeval2000对应组地结果。

5.2训练方案一实验:把bp神经网络相似性代替距离算法相似度量

        起初思路是采用两两相似性地训练,然后得出一个整体数据库属性特征的神经网络。采用表示X与Y两者相似性差异。在神经网络则表示为两者整体特征差异大小。假设这样能够成功,则以后只要判断测试数据与整体已知数据库地整体差异大小,就可以判断异常与否。
        神网络结构大概如下:
       
       
       
       
       
       
       
       
       
        注:每个方向箭头抽象全连接
        图 5.1 方案一图
       
        隐层采用85个可微阈值单元,输出采用一个,网络全连接。每个单元为86个权重,初始化权值按4.2给出的方法。
        具体方式,对已知数据集做两两训练,比如数据X和Y,做差fabsf(Xi - Yi),然后输入一个BP神经网络,已知数据库中第86个属性,(X 86,Y86)对应为(0,0)则教师信号为1,(1,1)则教师信号为1,(0,1)则为0,部分顺序。
        实验训练数据库100与4000组数据做两两训练还有4000组与4000组数据训练。
        经观察验证,测试数据与已知数据地相似性与否没法与测试计算结果数据存在必然地比例关系。输出结果的所有数据,在0到1区间之间,不管相似不相似都集中分布在靠近0,没有区分度,不能明显表示相似与否地概念。然后又对测试数据与训练数据库,进行相似性求和,对比测试数据中异常点与非异常点与训练数据库地相似性和,依然没有区分度。
        经多次尝试,降低训练次数精度,本实验方案依然失败。
        经过大量实验,失败原因:第一,bp处理输出区分度不够,难以有判断方案。第二,训练方案地问题,数据集合里面,缺乏异常点地训练,bp权值能增长方向把小规模局部数据地特征给掩盖掉了,难以输出好地数据来区分。第三,数据特征不显著。第四,训练顺序导致。
        解决方法:第一种改变训练方案,改变判断方案;第二种改变神经网络结构,以便输出数据区分度更高,便于区别异常非异常。
       
5.3训练方案二实验:用单个神经网络对训练数据库整体特性进行学习
       
        实验设计思路:为避免上述问题,改变训练顺序和训练方法,单组数据输入单个bp神经网络。为尽量得出可区分地数据,强化局部异常点特性。
        实验方案:对神经网络BP1,先使用非异常点经行训练,教师信号为0。然后再对异常点进行训练,教师信号为1。
        (1) 对所有非异常点数据,按组分别对BP1进行训练,教师信号都为1,(ticdata2000.txt数据库里面大部分为正常数据)保存BP1权值;
        (2)加载BP1数据到BP2, 针对数据库每个异常点,教师信号统一修改为0.1至0.7之间地任何一个数值,正向(数据库地方向顺序)训练一次,再逆向训练一次。训练完后,保存训练权值。
        实验观察:测试数据库独个输进BP1计算。整个数据库的所有计算结果,不管异常点非异常点的计算结果,都在0到1这个区间内呈现正态分布。数据主要叠加在两个教师信号数值之间,难以区分。
        实验结果失败。数据难以区分。
        根据实际数据,越逼近1地越小于第二次训练地教师信号地,都为异常点。比如本次第一次训练教师信号1,第二次异常点信号0.7,结果异常点主要集中在小于0.7和大于0.8之间,其中小于0.5和大于0.9异常点占地比率最大。
        正态分布地两边。第二次训练把非异常数据都集中在两次教师信号中间。
        数据都呈现正态分布,不好处理,特别是两个教师信号数值中间区间异常点与非异常点占自己比例都是很大,难以区分。
        解决方案,找一种训练方法让异常非异常点往不同方向逼近,并使其不互相影响。
       
5.4训练方案三实验:多神经网络各种形式训练及其决策

5.4.1实验设计思路
        用一个神经网络表示异常点地特征,教师信号1;用另一个异常点表示非异常点地特征,教师信号0.为了有一个好地区分度。同时测试数据可以通过进行不同神经网络计算两次,以便得结果进行具体判断结果。算法结构图如图5.2.
       
       
       
       
       
       






                                                                     
        图 5.2 训练方案图
       
5.4.2实验方案及步骤
                 训练方案,把训练集合,分成两个集合,一个为正常数据集合,一个异常。每个训练次数少于40次(根据实际增长速度,减少控制次数),以便使数据有一定地区分度。训练强度不要太大,以便避免无法发现局部异常特征地数据。
        训练准备:训练采用ticdata2000.txt地前4000组数据,前85个属性为训练输入,第86个为训练用教师信号。观察测试采用所有ticeval2000.txt作为输入,tictgts2000.txt为测试数据实际结果,已知正常数据3762,异常238.,通过这个可以辅助分析。
        流程:
        (1)第一组数据单个输入BP1训练,保存相应BP1权值,教师信号0.0,ticdata2000正常数据训练;
        (2)第二组数据单个输入BP2训练,保存BP2权值,教师信号1.0,ticdata2000异常数据训练;
        测试方法:
        通过测试地两个数据库,输到训练后地两个神经网络,同时借助已知数据捕获有用数据进行分析。
        观察测试数据库计算分布结果分布情况,并统计分布情况(表5.1. 表5.2.表5.3表5.4)。

表 5.1        BP1正常测试数据地分布输出统计(tictgts2000中为0) (单位:个数)

输出范围        0.0-0.1        0.1-0.2        0.2-0.3        0.3-0.4        0.4-0.5        0.5-0.6        0.6-0.7        0.7-0.8        0.8-0.9        0.9-1.0        小于0.2        测试数据库正常数据
个数        3762        0        0        0        0        0        0        0        0        0        3762        3762

表 5.2        BP1异常测试数据地分布统计输出(tictgts2000中为1) (单位:个数)

输出范围        0.0-0.1        0.1-0.2        0.2-0.3        0.3-0.4        0.4-0.5        0.5-0.6        0.6-0.7        0.7-0.8        0.8-0.9        0.9-1.0        大于0.2        测试数据库异常数据
个数        238        0        0        0        0        0        0        0        0        0        0        238

5.3 BP2正常测试数据地输出统计(tictgts2000中为0) (单位:个数)
输出范围        0.0-0.1        0.1-0.2        0.2-0.3        0.3-0.4        0.4-0.5        0.5-0.6        0.6-0.7        0.7-0.8        0.8-0.9        0.9-1.0        大于0.2地数据        测试异常点数据数量
个数        0        0        0        0        0        0        4        7        26         201        238        238

表 5.4        BP2异常测试数据地输出统计(tictgts2000中为1) (单位:个数)
输出范围        0.0-0.1        0.1-0.2        0.2-0.3        0.3-0.4        0.4-0.5        0.5-0.6        0.6-0.7        0.7-0.8        0.8-0.9        0.9-1.0        小0.2地数据数        测试数据库正常数据数量
个数        0        0        0        1        0        36        54        163        512        2974        0        3762

5.4.3实验分析

        (单位:纵轴个数,横轴顺序表示每隔0.1地区间)
注:横轴表示0到1区间,比如1表示0到0.1计算结果分布,纵轴表示个数;
系列1表示异常点计算结果,系列2表示非异常点计算结果
图5.3使用已训练的BP1计算结果分布


        (单位:纵轴个数,横轴顺序表示每隔0.1地区间)
注:横轴表示0到1区间,比如1表示0到0.1计算结果分布,纵轴表示个数;
系列2表示异常点计算结果,系列1表示非异常点计算结果
图5.4使用已训练的BP2计算结果分布

        已知BP1保存的是正常数据地特性,越逼近0越是属于正常数据特性;BP2保存的是异常数据地特性。
        表5.1BP1计算,正异常数据地实际输出,集中在0-0.1之中。无大于0.1地任何数据。刚好所有正常数据都在0.1之下。
        表5.2BP1计算,异常数据地实际输出集中在0-0.1,证明异常数据特性被正常数据所包含。
        表5.3BP2计算,异常点数据集中在0.6-1.0之间,刚好是已知异常点个数。
        表5.4BP2计算,正常数据集中在1.4-1.0之间,BP2为异常点特性,证明正常数据有很大一部分特征与异常数据特征有交集。
        综合上面各个表和图5.3和图5.4分析:从上表可以推出,对于未知检测数据输入,呈现无法区分地现象。图5.3图5.4见数据呈现叠加分布,即分布一样,无法区分异常与异常与否。

5.4.4实验失败原因分析
        (1)可能是数据特征叠加问题,异常与分异常具有很强地交叉特征。


        单位:横轴属性顺序,纵轴属性数值。
注:训练数据库中的,每个点代表一个属性值,横轴代表属性顺序,纵轴代表属性值.
图 5.5组正常数据


        单位:横轴属性顺序,纵轴属性数值。
注:训练数据库中的,每个点代表一个属性值,横轴代表属性顺序,纵轴代表属性值.
图5.6一组异常数据
       
如图 5.5图5.6为两组库中地数据,大多数属性属于一个范围空间,这种情况在BP属于相似性很大地情况,很难区分开来。纵轴10以下比较集中,相似特征太多。
(2)BP结构过拟化。
解决设想,减少隐层个数,生成随机,空间具有两类特征地数据。

5.5BP调参实验

        对上面三个实验地隐层进行调整,主要分别取5个、15个、25个隐层单元进行训练测试。

5.5.1对实验一调整隐层实验
        实验方式主要通过对训练数据库地训练,然后采用测试数据库进行测试统计,实验一方案采用组测试数据与原训练数据库4000组两两计算,然后求和,结果为与元数据库整体相异地程度。根据数据分布,和原来测试结果进行对照分析。一下摘取部分信息。
        5、15、25个隐层结点训练后测试结果与已知结果对照表:
        表5.5 5个隐层测试结果前11组  (单位:相似度)
序号        1        2        3        4        5        6        7        8        9        10        11        12
异常与否        0        1        0        0        0        0        0        0        0        0        0        1
计算结果分布        3914.053        3414.24        3429.304        3415.592        3973.073        3954.139        3907.563        3410.469        3645.375        3410.466        3735.547        3549.66

表5.6 15个隐层测试结果前11组 (单位:相似度)
序号        1        2        3        4        5        6        7        8        9        10        11        12
异常与否        0        1        0        0        0        0        0        0        0        0        0        1
计算结果分布        507.3817        444.8667        719.5331        631.563        700.2726        1210.217        759.2085        776.8747        598.1374        1108.007        1171.494        671.9588



表5.7 15个隐层测试结果前12组  (单位:相似度)
序号        1        2        3        4        5        6        7        8        9        10        11        12
异常与否        0        1        0        0        0        0        0        0        0        0        0        1
计算结果分布        4252.073        4411.978        4254.276        4416.709        4603.945        4694.265        4606.797        4393.095        4260.611        4270.246        4454.932        4596.794
       
        通过表5.5 表5.6 表5.7 表计算结果分析,没有出现较好区分度,无法做未知数据异常与否地判断。同时也可看到与上面实验一样结果,证明不是算法问题,而是数据特征不好区分。

5.5.2对实验二调整隐层实验

        实验方式,调整隐层神经单元个数5、15、25分别做一次,每次训练完的权值去计算测试数据库,然后通过已知结果,统计异常点与非异常在0到1之间的分布情况,看是否有区分度较高地方案。
        实验计算结果:
        表5.8 5个隐层实验结果   单位:个数
分区        0.0-0.1        0.1-0.2        0.2-0.3        0.3-0.4        0.4-0.5        0.5-0.6        0.6-0.7        0.7-0.8        0.8-0.9        0.9-1.0
正常点分布        6        2554        610        588        4        0        0        0        0        0
异常点分布        0        147        23        67        1        0        0        0        0        0
       

        (单位:纵轴个数,横轴顺序表示每隔0.1地区间)
注:对照表5.8,横轴表示0到1区间,比如1表示0到0.1计算结果分布,纵轴表示个数;
系列1表示非异常点计算结果,系列2表示异常点计算结果
图5.7  5个隐层实验结果


表5.9 15个隐层实验结果  单位:个数
分区        0.0-0.1        0.1-0.2        0.2-0.3        0.3-0.4        0.4-0.5        0.5-0.6        0.6-0.7        0.7-0.8        0.8-0.9        0.9-1.0
正常点计算分布        0        0        45        557        625        1020        1086        409        20        0
异常点分布        0        0        2        22        36        67        70        41        0        0

5.10 25个隐层实验结果  单位:个数
分区        0.0-0.1        0.1-0.2        0.2-0.3        0.3-0.4        0.4-0.5        0.5-0.6        0.6-0.7        0.7-0.8        0.8-0.9        0.9-1.0
正常点分布        1146        2118        432        59        7        0        0        0        0        0
异常点分布        90        109        29        8        2        0        0        0        0        0






        (单位:纵轴个数,横轴顺序表示每隔0.1地区间)
注:对照表5.9,横轴表示0到1区间,比如1表示0到0.1计算结果分布,纵轴表示个数;
系列1表示非异常点计算结果,系列2表示异常点计算结果
图5.8  15个隐层实验结果




        (单位:纵轴个数,横轴顺序表示每隔0.1地区间)
注:对照表5.10,横轴表示0到1区间,比如1表示0到0.1计算结果分布,纵轴表示个数;
系列1表示非异常点计算结果,系列2表示异常点计算结果
图5.9  25个隐层实验结果

        通过表5.8、表5.9、表5.10、 图5.7、图5.8、图5.9观察分析,数据依然呈现之前实验地分布情况,不是BP算法隐层太多地问题。
5.5.3对实验三调整隐层实验
        分别把隐层单元改为5、15、25分别按实验三方案做实验。4000组测试数据。下面为计算结果分布。结果如表5.11至表5.13。
表5.11  5个隐层实验结果    单位:个数

分区        0.0-0.1        0.1-0.2        0.2-0.3        0.3-0.4        0.4-0.5        0.5-0.6        0.6-0.7        0.7-0.8        0.8-0.9        0.9-1.0
正常点分布        0        0        0        0        207        3495        60        0        0        0
异常点分布        0        0        0        0        12        218        8        0        0        0


表5.12  15个隐层实验结果  单位:个数

分区        0.0-0.1        0.1-0.2        0.2-0.3        0.3-0.4        0.4-0.5        0.5-0.6        0.6-0.7        0.7-0.8        0.8-0.9        0.9-1.0
正常点分布        427        1336        1617        368        11        3        0        0        0        0
异常点分布        43        85        102        8        0        0        0        0        0        0


表5.13  25个隐层实验结果  单位:个数

分区        0.0-0.1        0.1-0.2        0.2-0.3        0.3-0.4        0.4-0.5        0.5-0.6        0.6-0.7        0.7-0.8        0.8-0.9        0.9-1.0
正常点计算分布        0        0        0        3        16        140        399        1149        1829        226
异常点分布        0        0        0        0        3        8        50        79        89        9



        (单位:纵轴个数,横轴顺序表示每隔0.1地区间)
注:对照表5.11,横轴表示0到1区间,比如1表示0到0.1计算结果分布,纵轴表示个数;
系列1表示非异常点计算结果,系列2表示异常点计算结果
图5.10  5个隐层实验结果



        (单位:纵轴个数,横轴顺序表示每隔0.1地区间)
注:对照表5.12,横轴表示0到1区间,比如1表示0到0.1计算结果分布,纵轴表示个数;
系列1表示非异常点计算结果,系列2表示异常点计算结果
图5.11  15个隐层实验结果



        (单位:纵轴个数,横轴顺序表示每隔0.1地区间)
注:对照表5.13,横轴表示0到1区间,比如1表示0到0.1计算结果分布,纵轴表示个数;
系列1表示非异常点计算结果,系列2表示异常点计算结果
5.12  25个隐层实验结果

        数据分布一样,无法区分。
        通过上面几个实验可以知道,并非BP结构过拟化,应该是数据问题。
       
5.6数据仿真实验

5.6.1实验思路

        根据实验5.5失败原因分析设计,规范化数据,随机生成具备两类特征数据。本实验BP结构采用隐层5个神经元,输出层一个。出于简化方案,只训练非异常数据,异常数据特征不太可控。
       
5.6.2实验步骤

        生成随机数据,正常数据五个属性每个都限制在0-0.5之前,异常数据每个属性都限制在0.5-1.0之间。先生成20组数据,17组正常数据,3组异常。
        接入神经网络对非异常数据进行训练。组数据结束条件教师信号与实际输出相差绝对值 0.5和次数time 300次。
        保存训练后权值,对原训练数据进行收敛性检查,同时查看二十组数据分布。
        随机生成具备(1)特征地另一组数据,采用(2)已经训练地权值,进行计算测试,查看分析结果数据分布。


(单位:纵轴属性值,横轴顺序表示属性顺序,同一种图形表示一组数据)
注:正常数据五个属性每个都限制在0-0.5之前,异常数据每个属性都限制在0.5-1.0之间。总20组,17组正常数据,3组异常。每一组数据由一种图形构成。17,18,19为异常数据。
图5.13 随机数


5.6.3实验结果

        训练完后神经网络与训练数据计算结果,如图5.14。
        计算第二组生成地随机测试数据,结果如图5.15。

        单位:横轴表示顺序,纵轴表示计算结果数值。
图5.14 测试训练收敛与否(每个点代表一个结果)

5.6.4结果分析
        根据上面结果,可以看出BP具备特征记忆能力能够在这种情况下被使用,并且能够区分自身训练集合地特征。图5.14正常点计算范围集中在0.47到0.5之间,异常点计算结果在0.43-0.46之间,可以明显区分开发来。同样图5.15也可以区分清楚。证明BP具备一定数据特征筛选能力。在本实验过程中同时进行了不同数据集合地实验,多属性特征穿插混淆,总体能够的到稳定结果,多属性特征则比较不稳定。
       
5.7实验整体分析

        根据上面实验,总地来说在实际异常点检测上面,单纯BP神经网未能达到预期异常点检测地效果,5.2,5.3,5.4的实验都失败,不管异常非异常在训练后,计算结果分布都呈现难以区分判断地现象。5.2呈现无规则分布,总体呈现靠近非异常点教师信号分布,对未知数据无法得到确切的判断方案。对于5.3和5.4也一样,5.3计算结果呈现正态分布,异常与非异常点计算结果都是,很难获得一个较高准确率地检测方案,数据较集中分布状况一样,无法很好分离开来,5.4同样也出现分布状况一样地现象。究其原因,可能是BP结构隐层单元过多,数据特性之间交叉特性太多,以使计算结果无法区分开来。5.5证明不是BP结构问题,而是由于数据特征相似性太大,只有一两个属性相异来分类。对于大规模多特征地数据集合,单纯BP很难做出很好解决方案。通过在图表中显示地coil2000异常与非异常数据,具有很高地相似性,只有小部分属性分布不同,很难使用bp获得很好地分离方案。
       
       

        单位:横轴表示顺序,纵轴表示计算结果数值。
图5.15 测试训练收敛与否(每个点代表一个结果)

        但是实验5.6却有让我们看到了希望,对于区别单一、两类特征数据,还是具备相当地可行性。试验中我们采用了两类特征地随机数,得到了很好地区分度。根据数据分布,可以很好得到判断方案。可见BP具备一定的分类器能力,采用多分类器方法对数据集合进行学习,还是具备一定地可行性。当然实际应用还会出现其他很多需要解决地问题。
        通过实验5.6后面实验过程多特征地实验地经历,可以知道如果做分类器对待多特征可以采用多BP网络学习。同时对于出现特征交叉的问题,比如数据组A的前几个属性和B数据组前几个属性一样,然后最后属性存在不同,属于不同类(异常和非异常),对与这种情况很难处理。时间限制未作深入研究。

总结与展望
        综上分析所述,BP具备一定特征分类能力,但是要通过这种分类能力去做异常点检测需要考虑很多因素,并且需要做很多辅助工作。特别是对于不同类数据而且特征较少数据,难以分离区别。
        假设应用BP神经网络做异常点检测,实际应用则采用BP充当分类器,并且根据特征采用多分类器结构,解决数据多特征问题。同时对于那些不同类而且是数据特征相似性较大(比如很多属性处在相同空间范围,局部属性不同)则需要采用更多神经网络训练这些特征,以便分离,或者采用专家系统方式,对这些具备相似性较高而又不同类进行量化可控地判断。同时对于超出已知范畴特性地数据,进行保存处理,训练出新的神经网络,同时通过人工专家系统进行更新。这样保证在可控范围能得到更高准确性。
        同样如果能够有好地方案,能够明显获得已知数据特征,并且能够很好分离相近特征属性的方案,那将是有很好速度检测到异常数据,同时配合专家决策系统能够使结果更具实际地准确性,而不是单纯地数据异常准确性。当然这建立在已知数据集合有足够丰富特征。对于未知数据特征可以报警,通过人工干预使系统学习到新特征,或者自动控制地方法学习。
        总地来说,使用神经网络分类,对于相似性比较高,差异集中在局部特征的数据,可以使用特征映射相关技术遗传算法、启发式搜索、特征随机选取等得到这些特征差异。对于正常数据多特征地问题,特别是正常数据有多类数据的,可以采用多神经网络融合,即多神经网络记录多特征。
       

参考文献
[1]                Hawkins D. Identification of Outliers[M]. London.Chapman and hall. 1980.
[2]                Edwin M. Knorr, Raymond T. Ng,Vladimir Tucakov. Distance-Based Outlier:Algorithms Applications[J].VLDB.2000.8(3-4):237-253.
[3]                Edwin M. Knorr, Raymod T. Ng. Algorithms for Mining Distance-Based Outliers in Large Datasets[R]. Very Large Data Bases Conference Proceedings.1998:24-27.
[4]                王元明,熊伟. 异常数据的检测方法[J]. 重庆工业学院学报(自然科学),2009,第23卷:86-89.
[5]                杨永铭,王喆. 孤立点算法研究[J]. 计算机与数字工程,2008,219期:11-15.
[6]                Aleksandar Lazarevic, Vipin Kumar. Feature Bagging for Outlier Detection[C]. Proceedings of the eleventh ACM SIGKDD international conference on Knowledge discovery in data mining,Chicago, Illinois, USA,Pages: 157 - 166 .
[7]                Tom M.Mitchell. 机器学习[M]. 北京:机械工业出版社,2002:60-90.
[8]                Jiawei Han. 数据挖掘概念与技术[M]. 北京:机械工业出版社,2006:295-301.
[9]                马少平,朱小燕. 人工智能[M]. 北京:清华出版社,2007:245-268.
[10]                彭清娥,曹叔尤,刘兴年,黄尔,李昌志. BP算法中固定学习率的性能分析[A].成都:四川大学高速水力学国家重点实验室,2000.
[11]                Stefano Melacci, Marco Maggini, Lorenzo Sarti. Semi-supervised Clustering using Similarity Neural Networks[A]. Proceedings of International Joint Conference on Neural Networks[C], Atlanta, Georgia, USA, June 14-19, 2009.
[12]                李炎,李皓. 异常检测算法分析[J]. 计算机工程,2002,28(6):5-6,32.
[13]                鄢团军,刘勇. 孤立点检测算法与应用[J]. 三峡大学学报(自然科学版),2009,31(1):98-102.
[14]                刘合兵,尚俊平. 基于距离和密度的聚类和孤立检测算法[J]. 河南师范大学学报(自然科学版),2008,38(3):38-40.
[15]                张宁. 离群点检测算法研究[J]. 桂林电子科技大学学报,2009,29(1):22-25.

致  谢

        本论文是在我的指导老师王丽娟老师的亲切关怀和悉心指导下完成的。她严肃的科学态度,严谨的治学精神,精益求精的工作作风,深深地感染和激励这我。从题目的选择到最终完成,王丽娟老师适中基于我细心的指导和不懈的支持。比如题目开题研究前期,老师帮忙找了很多资料,并及时和我沟通,因为前期在外实习,有时候老师还会打电话询问具体进度,并及时对出现问题进行引导。后期实验出现了问题,在老师指导下才知道如何论证本算法地可行性,并支持了我设计上地一些问题。这些都给我很大地帮助。也是一步步支持我能够圆满结题地推动力。在此,感谢老师地辛勤付出!愿一切顺利平安!
www06681com
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 注册会员

本版积分规则

闲聊灌水

    闲聊灌水

    板块简介:闲来没事,随便聊聊,聊人生

  • 今日主题: 0/全部主题: 104660
  •  发布规则

      1.论坛环境需要大家共同珍惜,在玉都风情网尽可能给予大家最大的自由限度的同时,也敬请大家不要恶意灌水.

      2.适当顾及一下其他会员的感受,同一类型的帖子尽可能发在同一条主题帖内,连续发同一类型超过五条连续的主题帖子,视为恶意灌水,第一次发,予以劝告,第二次恶意再发,示以警告,第三次恶意发将会删除,第四次发将会封闭ID处理,谢谢配合。

      3.尽量不要在一个主题帖内重复回复相同的内容进行恶意灌水或把相同的回复内容在不同主题帖子中回复。违者可能会被酌情作出处理.

      4.请勿发表违反国家四项基本原则,涉及反动反政反党的帖子,以及色情内容和其它违法的内容。

      5.如果您某天发现了自己的帖子或评论抑或回复不见了,如果您某天发现自己被禁言一至数天或永久禁言,请参考以上4条。


      回复小贴士:
      1.类似“顶”、“沙发”之类没有营养的文字,对勤劳贡献的楼主来说是一个令人沮丧的反馈信息。

      2.请勿到处挖坑绊人、招贴广告。既占空间让人厌烦,又没人会搭理,于人于己都无利。

     热点图文

     最新动态

    7 X 24小时在线客服

    电话:0668-8884681

    手机:13510735541(微信同号)

    客服QQ1:1592772589
    邮件:admin@06681.com
    Copyright © 2023-2026 信宜玉都风情网版权所有 All Rights Reserved
    免责申明:本网不承担任何由内容提供商提供的信息所引起的争议和法律责任
    Powered by Discuz! X3.3 技术支持:信宜玉都风情 粤ICP备20049602号-1 粤公网安备44098302440990号