


下載本文檔
版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請進行舉報或認領(lǐng)
文檔簡介
分析:數(shù)據(jù)挖掘基礎(chǔ)知識介紹
在市場需求和技術(shù)基礎(chǔ)這兩個因素都具備的環(huán)境下,數(shù)據(jù)挖掘技術(shù)的概念和技術(shù)就應(yīng)運而生了?;靖拍顢?shù)據(jù)挖掘(DataMining)旨在從大量的、不完全的、有噪聲的、模糊的、隨機的數(shù)據(jù)中,提取隱含在其中的、人們事先不知道的、但又是潛在有用的信息和知識。還有很多和這一術(shù)語相近似的術(shù)語,如從數(shù)據(jù)庫中發(fā)現(xiàn)知識(KDD)、數(shù)據(jù)分析、數(shù)據(jù)融合(DataFusion)以及決策支持等?;救蝿?wù)數(shù)據(jù)挖掘的任務(wù)主要是關(guān)聯(lián)分析、聚類分析、分類、預(yù)測、時序模式和偏差分析等。1關(guān)聯(lián)分析associationanalysis關(guān)聯(lián)規(guī)則挖掘由RakeshApwal等人首先提出。兩個或兩個以上變量的取值之間存在的規(guī)律性稱為關(guān)聯(lián)。數(shù)據(jù)關(guān)聯(lián)是數(shù)據(jù)庫中存在的一類重要的、可被發(fā)現(xiàn)的知識。關(guān)聯(lián)分為簡單關(guān)聯(lián)、時序關(guān)聯(lián)和因果關(guān)聯(lián)。關(guān)聯(lián)分析的目的是找出數(shù)據(jù)庫中隱藏的關(guān)聯(lián)網(wǎng)。一般用支持度和可信度兩個閥值來度量關(guān)聯(lián)規(guī)則的相關(guān)性,還不斷引入興趣度、相關(guān)性等參數(shù),使得所挖掘的規(guī)則更符合需求。2聚類分析clustering聚類是把數(shù)據(jù)按照相似性歸納成若干類別,同一類中的數(shù)據(jù)彼此相似,不同類中的數(shù)據(jù)相異。聚類分析可以建立宏觀的概念,發(fā)現(xiàn)數(shù)據(jù)的分布模式,以及可能的數(shù)據(jù)屬性之間的相互關(guān)系。3分類classification分類就是找出一個類別的概念描述,它代表了這類數(shù)據(jù)的整體信息,即該類的內(nèi)涵描述,并用這種描述來構(gòu)造模型,一般用規(guī)則或決策樹模式表示。分類是利用訓(xùn)練數(shù)據(jù)集通過一定的算法而求得分類規(guī)則。分類可被用于規(guī)則描述和預(yù)測。4預(yù)測predication預(yù)測是利用歷史數(shù)據(jù)找出變化規(guī)律,建立模型,并由此模型對未來數(shù)據(jù)的種類及特征進行預(yù)測。預(yù)測關(guān)心的是精度和不確定性,通常用預(yù)測方差來度量。5時序模式time-seriespattern時序模式是指通過時間序列搜索出的重復(fù)發(fā)生概率較高的模式。與回歸一樣,它也是用己知的數(shù)據(jù)預(yù)測未來的值,但這些數(shù)據(jù)的區(qū)別是變量所處時間的不同。6偏差分析deviation在偏差中包括很多有用的知識,數(shù)據(jù)庫中的數(shù)據(jù)存在很多異常情況,發(fā)現(xiàn)數(shù)據(jù)庫中數(shù)據(jù)存在的異常情況是非常重要的。偏差檢驗的基本方法就是尋找觀察結(jié)果與參照之間的差別?;炯夹g(shù)1統(tǒng)計學(xué)統(tǒng)計學(xué)雖然是一門“古老的”學(xué)科,但它依然是最基本的數(shù)據(jù)挖掘技術(shù),特別是多元統(tǒng)計分析,如判別分析、主成分分析、因子分析、相關(guān)分析、多元回歸分析等。2聚類分析和模式識別聚類分析主要是根據(jù)事物的特征對其進行聚類或分類,即所謂物以類聚,以期從中發(fā)現(xiàn)規(guī)律和典型模式。這類技術(shù)是數(shù)據(jù)挖掘的最重要的技術(shù)之一。除傳統(tǒng)的基于多元統(tǒng)計分析的聚類方法外,近些年來模糊聚類和神經(jīng)網(wǎng)絡(luò)聚類方法也有了長足的發(fā)展。3決策樹分類技術(shù)決策樹分類是根據(jù)不同的重要特征,以樹型結(jié)構(gòu)表示分類或決策集合,從而產(chǎn)生規(guī)則和發(fā)現(xiàn)規(guī)律。4人工神經(jīng)網(wǎng)絡(luò)和遺傳基因算法人工神經(jīng)網(wǎng)絡(luò)是一個迅速發(fā)展的前沿研究領(lǐng)域,對計算機科學(xué)人工智能、認知科學(xué)以及信息技術(shù)等產(chǎn)生了重要而深遠的影響,而它在數(shù)據(jù)挖掘中也扮演著非常重要的角色。人工神經(jīng)網(wǎng)絡(luò)可通過示例學(xué)習(xí),形成描述復(fù)雜非線性系統(tǒng)的非線性函數(shù),這實際上是得到了客觀規(guī)律的定量描述,有了這個基礎(chǔ),預(yù)測的難題就會迎刃而解。目前在數(shù)據(jù)挖掘中,最常使用的兩種神經(jīng)網(wǎng)絡(luò)是BP網(wǎng)絡(luò)和RBF網(wǎng)絡(luò)不過,由于人工神經(jīng)網(wǎng)絡(luò)還是一個新興學(xué)科,一些重要的理論問題尚未解決。5規(guī)則歸納規(guī)則歸納相對來講是數(shù)據(jù)挖掘特有的技術(shù)。它指的是在大型數(shù)據(jù)庫或數(shù)據(jù)倉庫中搜索和挖掘以往不知道的規(guī)則和規(guī)律,這大致包括以下幾種形式:IF…THEN…6可視化技術(shù)可視化技術(shù)是數(shù)據(jù)挖掘不可忽視的輔助技術(shù)。數(shù)據(jù)挖掘通常會涉及較復(fù)雜的數(shù)學(xué)方法和信息技術(shù),為了方便用戶理解和使用這類技術(shù),必須借助圖形、圖象、動畫等手段形象地指導(dǎo)操作、引導(dǎo)挖掘和表達結(jié)果等,否則很難推廣普及數(shù)據(jù)挖掘技術(shù)。實施步驟數(shù)據(jù)挖掘的過程可以分為6個步驟:1)理解業(yè)務(wù):從商業(yè)的角度理解項目目標和需求,將其轉(zhuǎn)換成一種數(shù)據(jù)挖掘的問題定義,設(shè)計出達到目標的一個初步計劃。2)理解數(shù)據(jù):收集初步的數(shù)據(jù),進行各種熟悉數(shù)據(jù)的活動。包括數(shù)據(jù)描述,數(shù)據(jù)探索和數(shù)據(jù)質(zhì)量驗證等。3)準備數(shù)據(jù):將最初的原始數(shù)據(jù)構(gòu)造成最終適合建模工具處理的數(shù)據(jù)集。包括表、記錄和屬性的選擇,數(shù)據(jù)轉(zhuǎn)換和數(shù)據(jù)清理等。4)建模:選擇和應(yīng)用各種建模技術(shù),并對其參數(shù)進行優(yōu)化。5)模型評估:對模型進行較為徹底的評價,并檢查構(gòu)建模型的每個步驟,確認其是否真正實現(xiàn)了預(yù)定的商業(yè)目的。6)模型部署:創(chuàng)建完模型并不意味著項目的結(jié)束,即使模型的目的是為了增進對數(shù)據(jù)的了解,所獲得的知識也要用一種用戶可以使用的方式來組織和表示。通常要將活動模型應(yīng)用到?jīng)Q策制訂的過程中去。該階段可以簡單到只生成一份報告,也可以復(fù)雜到在企業(yè)內(nèi)實施一個可重復(fù)的數(shù)據(jù)挖掘過程??刂频玫狡毡槌姓J。應(yīng)用現(xiàn)狀人工智能研究領(lǐng)域的科學(xué)家普遍認為,下一個人工智能應(yīng)用的重要課題之一,將是以機器學(xué)習(xí)算法為主要工具的大規(guī)模的數(shù)據(jù)庫知識發(fā)現(xiàn)。盡管數(shù)據(jù)挖掘還是一個很新的研究課題,但它所固有的為企業(yè)創(chuàng)造巨大經(jīng)濟效益的潛力,已使其很快有了許多成功的應(yīng)用,具有代表性的應(yīng)用領(lǐng)域有市場預(yù)測、投資、制造業(yè)、銀行、通訊等。英國廣播公司(BBC)也應(yīng)用數(shù)據(jù)挖掘技術(shù)來預(yù)測電視收視率,以便合理安排電視節(jié)目時刻表。信用卡公司AlllelicallKxT,ress自采用數(shù)據(jù)挖掘技術(shù)后,信用卡使用率增加了10%一15%。AT&T公司賃借數(shù)據(jù)挖掘技術(shù)技術(shù)偵探國際電話欺詐行為,可以盡快發(fā)現(xiàn)國際電話使用中的不正常現(xiàn)象。數(shù)據(jù)挖掘是一個新興的邊緣學(xué)
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
- 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
- 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護處理,對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對任何下載內(nèi)容負責(zé)。
- 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔(dān)用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 2024年汽車美容師技能框架圖解試題及答案
- 汽車維修工考試中常見問題的解決方案試題及答案
- 2024年CPBA考試的注意事項試題及答案
- 國際寵物營養(yǎng)標準對比考題試題及答案
- 2024年六年級語文實際應(yīng)用試題及答案
- 二手車評估中的質(zhì)量控制與監(jiān)測試題及答案
- 二手車評估師考試常見問題及試題及答案
- 2024年計算機基礎(chǔ)考試自信應(yīng)戰(zhàn)及答案
- 2024年計算機基礎(chǔ)學(xué)習(xí)路徑試題及答案
- 幼兒園指導(dǎo)綱要培訓(xùn):藝術(shù)領(lǐng)域
- 2024年中考語文復(fù)習(xí)分類必刷:非連續(xù)性文本閱讀(含答案解析)
- DL∕ T 949-2005 水工建筑物塑性嵌縫密封材料技術(shù)標準
- 河南科學(xué)技術(shù)出版社小學(xué)信息技術(shù)六年級上冊教案
- 2024年紅十字應(yīng)急救護知識競賽考試題庫500題(含答案)
- TD/T 1061-2021 自然資源價格評估通則(正式版)
- 2024年四川省成都市高新區(qū)中考數(shù)學(xué)二診試卷
- 2024年社區(qū)工作者考試必考1000題附完整答案【典優(yōu)】
- WMT8-2022二手乘用車出口質(zhì)量要求
- 30題質(zhì)量檢驗員崗位常見面試問題含HR問題考察點及參考回答
- 智能燈具故障排除方案
- 20道瑞幸咖啡營運經(jīng)理崗位常見面試問題含HR常問問題考察點及參考回答
評論
0/150
提交評論