
做好數據挖掘模型,有什么好的經驗推薦?
數據挖掘是利用業務知識從數據中發現和解釋知識(或稱為模式)的過程,這種知識是以自然或者人工形式創造的新知識。
第一,目標律:業務目標是所有數據解決方案的源頭。
它定義了數據挖掘的主題:數據挖掘關注解決業務業問題和實現業務目標。數據挖掘主要不是一種技術,而是一個過程,業務目標是它的的核心。 沒有業務目標,沒有數據挖掘(不管這種表述是否清楚)。因此這個準則也可以說成:數據挖掘是業務過程。
第二,知識律:業務知識是數據挖掘過程每一步的核心。
這里定義了數據挖掘過程的一個關鍵特征。CRISP-DM的一種樸素的解讀是業務知識僅僅作用于數據挖掘過程開始的目標的定義與最后的結果的實施,這將錯過數據挖掘過程的一個關鍵屬性,即業務知識是每一步的核心。
第三,準備律:數據預處理比數據挖掘其他任何一個過程都重要。
這是數據挖掘著名的格言,數據挖掘項目中最費力的事是數據獲取和預處理。非正式估計,其占用項目的時間為50%-80%。最簡單的解釋可以概括為“數據是困難的”,經常采用自動化減輕這個“問題”的數據獲取、數據清理、數據轉換等數據預處理各部分的工作量。雖然自動化技術是有益的,支持者相信這項技術可以減少數據預處理過程中的大量的工作量,但這也是誤解數據預處理在數據挖掘過程中是必須的原因。
數據預處理的目的是把數據挖掘問題轉化為格式化的數據,使得分析技術(如數據挖掘算法)更容易利用它。數據任何形式的變化(包括清理、最大最小值轉換、增長等)意味著問題空間的變化,因此這種分析必須是探索性的。 這是數據預處理重要的原因,并且在數據挖掘過程中占有如此大的工作量,這樣數據挖掘者可以從容地操縱問題空間,使得容易找到適合分析他們的方法。
有兩種方法“塑造”這個問題 空間。第一種方法是將數據轉化為可以分析的完全格式化的數據,比如,大多數數據挖掘算法需要單一表格形式的數據,一個記錄就是一個樣例。數據挖掘者都知道什么樣的算法需要什么樣的數據形式,因此可以將數據轉化為一個合適的格式。第二種方法是使得數據能夠含有業務問題的更多的信息,例如,某些領域的一些數據挖掘問題,數據挖掘者可以通過業務知識和數據知識知道這些。 通過這些領域的知識,數據挖掘者通過操縱問題空間可能更容易找到一個合適的技術解決方案。
因此,通過業務知識、數據知識、數據挖掘知識從根本上使得數據預處理更加得心應手。 數據預處理的這些方面并不能通過簡單的自動化實現。
這個定律也解釋了一個有疑義的現象,也就是雖然經過數據獲取、清理、融合等方式創建一個數據倉庫,但是數據預處理仍然是必不可少的,仍然占有數據挖掘過程一半以上的工作量。此外,就像CRISP-DM展示的那樣,即使經過了主要的數據預處理階段,在創建一個有用的模型的反復過程中,進一步的數據預處理的必要的。
第四,試驗律(NFL律:No Free Lunch):對于數據挖掘者來說,天下沒有免費的午餐,一個正確的模型只有通過試驗(experiment)才能被發現。
機器學習有一個原則:如果我們充分了解一個問題空間(problem space),我們可以選擇或設計一個找到最優方案的最有效的算法。一個卓越算法的參數依賴于數據挖掘問題空間一組特定的屬性集,這些屬性可以通過分析發 現或者算法創建。但是,這種觀點來自于一個錯誤的思想,在數據挖掘過程中數據挖掘者將問題公式化,然后利用算法找到解決方法。事實上,數據挖掘者將問題公式化和尋找解決方法是同時進行的—–算法僅僅是幫助數據挖掘者的一個工具。
第五,模式律(大衛律):數據中總含有模式。
這條規律最早由David Watkins提出。 我們可能預料到一些數據挖掘項目會失敗,因為解決業務問題的模式并不存在于數據中,但是這與數據挖掘者的實踐經驗并不相關。
前文的闡述已經提到,這是因為:在一個與業務相關的數據集中總會發現一些有趣的東西,以至于即使一些期望的模式不能被發現,但其他的一些有用的東西可能會被發現(這與數據挖掘者的實踐經驗是相關的);除非業務專家期望的模式存在,否則數據挖掘項目不會進行,這不應感到奇怪,因為業務專家通常是對的。
然而,Watkins提出一個更簡單更直接的觀點:“數據中總含有模式?!边@與數據挖掘者的經驗比前面的闡述更一致。這個觀點后來經過Watkins修正,基于客戶關系的數據挖掘項目,總是存在著這樣的模式即客戶未來的行為總是和先前的行為相關,顯然這些模式是有利可圖的(Watkins的客戶關系管理定律)。但是,數據挖掘者的經驗不僅僅局限于客戶關系管理問題,任何數據挖掘問題都會存在模式(Watkins的通用律)。
第六,洞察律:數據挖掘增大對業務的認知。
數據挖掘是如何產生洞察力的?這個定律接近了數據挖掘的核心:為什么數據挖掘必須是一個業務過程而不是一個技術過程。業務問題是由人而非算法解決的。數據挖掘者和業務專家從問題中找到解決方案,即從問題的定義域上達到業務目標需要的模式。數據挖掘完全或部分有助于這個認知過程。數據挖掘算法揭示的模式通常不是人類以正常的方式所能認識到的。綜合這些算法和人類正常的感知的數據挖掘過程在本質上是敏捷的。在數據挖掘過程中,問題解決者解釋數據挖掘算法產生的結果,并統一到業務理解上,因此這是一個業務過程。
這類似于“智能放大器”的概念,在早期的人工智能的領域,AI的第一個實際成果不是智能機器,而是被稱為“智能放大器”的工具,它能夠協助人類使用者提高獲取有效信息的能力。數據挖掘提供一個類似的“智能放大器”,幫助業務專家解決他們不能單獨完成的業務問題。
總之,數據挖掘算法提供一種超越人類以正常方式探索模式的能力,數據挖掘過程允許數據挖掘者和業務專家將這種能力融合在他們的各自的問題的中和業務過程中。
第七,預測律:預測提高了信息泛化能力。
“預測”已經成為數據挖掘模型可以做什么的可接受的描述,即我們常說的“預測模型”和“預測分析”。這是因為許多流行的數據挖掘模型經常使用“預測最可能的結果”(或者解釋可能的結果如何有可能)。這種方法是分類和回歸模型的典型應用。
但是,其他類型的數據挖掘模型,比如聚類和關聯模型也有“預測”的特征。這是一個含義比較模糊的術語。一個聚類模型被描述為“預測”一個個體屬于哪個群體,一個關聯模型可能被描述為基于已知基本屬性“預測”一個或更多屬性。
同樣我們也可以分析“預測”這個術語在不同的主題中的應用:一個分類模型可能被說成可以預測客戶行為—-更加確切的說它可以預測以某種確定行為的目標客戶,即使不是所有的目標個體的行為都符合“預測”的結果。一個詐騙檢測模型可能被說成可以預測個別交易是否具有高風險性,即使不是所有的預測的交易都有欺詐行為。
“預測”這個術語廣泛的使用導致了所謂的“預測分析”被作為數據挖掘的總稱,并且在業務解決方案中得到了廣泛的應用。但是我們應該意識到這不是日常所說的“預測”,我們不能期望預測一個特殊個體的行為或者一個特別的欺詐調查結果。
那么,在這個意義下的“預測”是什么?分類、回歸、聚類和 關 聯算法以及他們集成模型有什么共性呢?答案在于“評分”,這是預測模型應用到一個新樣例的方式。模型產生一個預估值或評分,這是這個樣例的新信息的一部 分;在概括和歸納的基礎上,這個樣例的可利用信息得到了提高,模式被算法發現和模型具體化。值得注意的是這個新信息不是在“給定”意義上的“數據”,它僅有統計學意義。
第八,價值律:數據挖掘的結果的價值不取決于模型的穩定性或預測的準確性。
準確性和穩定性是預測模型常用的兩個度量。準確性是指正確的預測結果所占的比例;穩定性是指當創建模型的數據改變時,用于同一口徑的預測數據,其預測結果變化有多大(或多?。?。鑒于數據挖掘中預測概念的核心角色,一個預測模型的準確性和穩定性常被認為決定了其結果的價值的大小,實際上并非如此。
體現預測模型價值的有兩種方式:一種是用模型的預測結果來改善或影響行為,另一種是模型能夠傳遞導致改變策略的見解(或新知識)。
對于后者,傳遞出的任何新知識的價值和準確性的聯系并不那么緊密;一些模型的預測能力可能有必要使我們相信發現的模式是真實的。然而,一個難以理解的復雜的 或者完全不透明的模型的預測結果具有高準確性,但傳遞的知識也不是那么有見地;然而,一個簡單的低準確度的模型可能傳遞出更有用的見解。
準確性和價值之間的分離在改善行為的情況下并不明顯,然而一個突出問題是“預測模型是為了正確的事,還是為了正確的原因?” 換句話說,一個模型的價值和它的預測準確度一樣,都源自它的業務問題。例如,客戶流失模型可能需要高的預測準確度,否則對于業務上的指導不會那么有效。相反的是一個準確度高的客戶流失模型可能提供有效的指導,保留住老客戶,但也僅僅是最少利潤客戶群體的一部分。如果不適合業務問題,高準確度并不能提高模型的價值。
模型穩定性同樣如此,雖然穩定性是預測模型的有趣的度量,穩定性不能代替模型提供業務理解的能力或解決業務問題,其它技術手段也是如此。
總之,預測模型的價值不是由技術指標決定的。數據挖掘者應該在模型不損害業務理解和適應業務問題的情況下關注預測準確度、模型穩定性以及其它的技術度量。
第九,變化律:所有的模式因業務變化而變化。
數據挖掘發現的模式不是永遠不變的。數據挖掘的許多應用是眾所周知的,但是這個性質的普遍性沒有得到廣泛的重視。
數據挖掘在市場營銷和CRM方面的應用很容易理解,客戶行為模式隨著時間的變化而變化。行為的變化、市場的變化、競爭的變化以及整個經濟形勢的變化,預測模型會因這些變化而過時,當他們不能準確預測時,應當定期更新。
數據挖掘在欺詐模型和風險模型的應用中同樣如此,隨著環境的變化欺詐行為也在變化,因為罪犯要改變行為以保持領先于反欺詐。欺詐檢測的應用必須設計為就像處理舊的、熟悉的欺詐行為一樣能夠處理新的、未知類型的欺詐行為。
某些種類的數據挖掘可能被認為發現的模式不會隨時間而變化,比如數據挖掘在科學上的應用,我們有沒有發現不變的普遍的規律?也許令人驚奇的是,答案是即使是這些模式也期望得到改變。理由是這些模式并不是簡單的存在于這個世界上的規則,而是數據的反應—-這些規則可能在某些領域確實是靜態的。
然而,數據挖掘發現的模式是認知過程的一部分,是數據挖掘在數據描述的世界與觀測者或業務專家的認知之間建立的一個動態過程。因為我們的認知在持續發展和增長,所以我們也期望模式也會變化。明天的數據表面上看起來相似,但是它可能已經集合了不同的模式、(可能巧妙地)不同的目的、不同的語義;分析過程因受業務知識驅動,所以會隨著業務知識的變化而變化?;谶@些原因,模式會有所不同。
數據分析咨詢請掃描二維碼
若不方便掃碼,搜微信號:CDAshujufenxi
CDA數據分析師證書考試體系(更新于2025年05月22日)
2025-05-26解碼數據基因:從數字敏感度到邏輯思維 每當看到超市貨架上商品的排列變化,你是否會聯想到背后的銷售數據波動?三年前在零售行 ...
2025-05-23在本文中,我們將探討 AI 為何能夠加速數據分析、如何在每個步驟中實現數據分析自動化以及使用哪些工具。 數據分析中的AI是什么 ...
2025-05-20當數據遇見人生:我的第一個分析項目 記得三年前接手第一個數據分析項目時,我面對Excel里密密麻麻的銷售數據手足無措。那些跳動 ...
2025-05-20在數字化運營的時代,企業每天都在產生海量數據:用戶點擊行為、商品銷售記錄、廣告投放反饋…… 這些數據就像散落的拼圖,而相 ...
2025-05-19在當今數字化營銷時代,小紅書作為國內領先的社交電商平臺,其銷售數據蘊含著巨大的商業價值。通過對小紅書銷售數據的深入分析, ...
2025-05-16Excel作為最常用的數據分析工具,有沒有什么工具可以幫助我們快速地使用excel表格,只要輕松幾步甚至輸入幾項指令就能搞定呢? ...
2025-05-15數據,如同無形的燃料,驅動著現代社會的運轉。從全球互聯網用戶每天產生的2.5億TB數據,到制造業的傳感器、金融交易 ...
2025-05-15大數據是什么_數據分析師培訓 其實,現在的大數據指的并不僅僅是海量數據,更準確而言是對大數據分析的方法。傳統的數 ...
2025-05-14CDA持證人簡介: 萬木,CDA L1持證人,某電商中廠BI工程師 ,5年數據經驗1年BI內訓師,高級數據分析師,擁有豐富的行業經驗。 ...
2025-05-13CDA持證人簡介: 王明月 ,CDA 數據分析師二級持證人,2年數據產品工作經驗,管理學博士在讀。 學習入口:https://edu.cda.cn/g ...
2025-05-12CDA持證人簡介: 楊貞璽 ,CDA一級持證人,鄭州大學情報學碩士研究生,某上市公司數據分析師。 學習入口:https://edu.cda.cn/g ...
2025-05-09CDA持證人簡介 程靖 CDA會員大咖,暢銷書《小白學產品》作者,13年頂級互聯網公司產品經理相關經驗,曾在百度、美團、阿里等 ...
2025-05-07相信很多做數據分析的小伙伴,都接到過一些高階的數據分析需求,實現的過程需要用到一些數據獲取,數據清洗轉換,建模方法等,這 ...
2025-05-06以下的文章內容來源于劉靜老師的專欄,如果您想閱讀專欄《10大業務分析模型突破業務瓶頸》,點擊下方鏈接 https://edu.cda.cn/g ...
2025-04-30CDA持證人簡介: 邱立峰 CDA 數據分析師二級持證人,數字化轉型專家,數據治理專家,高級數據分析師,擁有豐富的行業經驗。 ...
2025-04-29CDA持證人簡介: 程靖 CDA會員大咖,暢銷書《小白學產品》作者,13年頂級互聯網公司產品經理相關經驗,曾在百度,美團,阿里等 ...
2025-04-28CDA持證人簡介: 居瑜 ,CDA一級持證人國企財務經理,13年財務管理運營經驗,在數據分析就業和實踐經驗方面有著豐富的積累和經 ...
2025-04-27數據分析在當今信息時代發揮著重要作用。單因素方差分析(One-Way ANOVA)是一種關鍵的統計方法,用于比較三個或更多獨立樣本組 ...
2025-04-25CDA持證人簡介: 居瑜 ,CDA一級持證人國企財務經理,13年財務管理運營經驗,在數據分析就業和實踐經驗方面有著豐富的積累和經 ...
2025-04-25