熱線電話:13121318867

登錄
首頁精彩閱讀給師弟師妹們學習數據挖掘的一些建議
給師弟師妹們學習數據挖掘的一些建議
2018-07-05
收藏

給師弟師妹們學習數據挖掘的一些建議

看著剛進實驗室的師弟師妹們的迷茫,雖然也與他們進行過一些零散的交談,但是都不夠系統。因此,根據自己的經歷給出學習數據挖掘的一些建議,大家可以根據自身的情況,具體問題具體分析,作為參考。希望在上一屆的基礎上,走的更深,走的更遠。

一. 讀研與數據挖掘基礎

首先介紹一下大家都比較關心的幾個問題,包括我們組的研究方向是什么,論文相關問題,大數據與工作相關問題,上海戶口問題幾個方面。

1. 我們組的研究方向是什么

我們組大的研究方向是數據挖掘,論文的研究方向是推薦算法。要注意大的研究方向,論文的研究方向與工作方向的區別和聯系。

2. 論文相關問題

讀研究生免不了會思考一個問題,讀研的意義是什么?我自己認為讀研的最大意義是訓練自己系統化的嚴謹的分析思維能力。在導師給定論文研究方向后,如何確立更細的研究方向,如何檢索資料,如何閱讀英文論文,如何提出自己的創新點,如何做實驗,如何寫論文,如何修改論文,如何投稿,如何退修,如果是國際會議,還要去做英文口頭報告,與同行交流等,這些問題都是需要自己去思考的。

3. 大數據與工作相關問題

數據挖掘屬于大數據專業嗎?當然屬于?,F在大數據找工作相對還是比較理想的。關鍵是要學習哪些課程呢?以前給大家推薦了很多的書籍,但是效果卻恰恰相反,因為實在太多了根本看不完,更不知閱讀書籍的順序,淺嘗輒止,最后一本書也沒有看完,研究生就結束了。

(1)最低保障書籍

無論將來做什么,熟練掌握一門編程語言,一個數據庫,數據結構,算法都是必備的。

《高性能MySQL

數據結構與算法分析:Java語言描述》

《算法》:http://book.douban.com/subject/19952400/

(2)Python與機器學習

《集體智慧編程》

《社交網站的數據挖掘與分析》

數據挖掘:概念與技術》

  Python官方文檔:https://www.python.org/

  Scikit-Learn官方文檔:http://scikit-learn.org/stable/

(3)Java相關書籍

《Java開發實戰經典》

《Java Web開發實戰經典》

《Java虛擬機規范》

  Java SE:http://docs.oracle.com/javase/8/docs/api/

  Java EE:http://docs.oracle.com/javaee/6/api/

(4)Hadoop與Spark書籍

《大數據日知錄:架構與算法》

Hadoop權威指南》

《大數據Spark企業級實戰》

《Scala編程》

   Hadoop官方網站:http://spark.apache.org/

   Spark官方網站:http://spark.apache.org/

   Scala官方網站:http://www.scala-lang.org/

說明:認準目標,耐住性子,一步一步往前走。要把上面推薦的書籍硬著頭皮讀完,數據挖掘基本也就算是入門了。

4. 上海戶口問題

上海戶口屬于積分制,如果想要在校期間就拿到,那么唯一的方式就是參數每年的研究生數據建模比賽,并且獲獎。獲獎比例還是很高的。其實,好好學習Python,買本數學建模的書籍看完,看幾篇近些年來的獲獎論文,比賽時硬著頭皮鉆研一道題目并且寫好論文,基本上都可以獲獎。

二. 數據挖掘進階

數據挖掘涉及多個方向,但是通常從數學統計,數據庫和數據倉庫,機器學習三個方向來進行研究。當我想學習一個方向的時候,最希望做的事情就是讓別人給我列出一個書單。因為我也會給你們列出一個書單,讓你們慢慢研究吧。

1. 數學統計

(1)理論數學:復變函數,實變函數,泛函分析,拓撲學,積分變換,微分流形,常微分方程,偏微分方程等。
(2)應用數學:離散數學(集合,邏輯,組合,代數,圖論,數論),具體數學,張量分析,數值計算,矩陣論,逼近論,運籌學,凸優化,小波變換,時間序列分析等。
(3)概率:概率論,測度論,隨機過程等。
(4)統計:統計學,多元統計,貝葉斯統計,統計模擬,非參數統計,參數統計等。

2. 數據庫和數據倉庫

《數據庫系統概念》

《數據庫系統實現》

數據倉庫

《分布式系統:概念與設計》

3. 機器學習

通信原理;數據挖掘;機器學習;統計學習;自然語言處理;信息檢索;模式識別;人工智能;圖形圖像;機器視覺;語音識別;機器人學等。(這方面的經典書籍都可以看看,后面慢慢補充)

4. 其它書籍

(1)Linux

(2)網絡原理,編譯原理,組成原理,

(3)JVM

(4)UML

(5)軟件工程

(6)設計模式

(7)云計算與Docker

(8)并行計算

(9)需求分析

三. 學習與方法 

作為一名軟件工程師,需要熟練掌握的工具,如下所示:
(1)博客

除了學習之外,更要思考和總結,把還沒有忘卻的記憶緩存序列化成為文字,記錄在博客中。

(2)語言

大數據常用的語言包括Java,Scala,Python。如果一定要選擇精通一門語言,自己選擇Scala,同時深度學習JVM。(3)開發工具

自己選擇IntelliJ IDEA用于Java和Scala的開發,Eclipse用于Python的開發。
(4)GitHub

每天都要堅持編程,主動參與開源項目。
(5)Linux

工作常用的是Ubuntu 12.04 LTS。

由于時間原因,上面總結的還比較粗糙,算是第一個版本吧,后面還會繼續深度總結和完善。


數據分析咨詢請掃描二維碼

若不方便掃碼,搜微信號:CDAshujufenxi

數據分析師資訊
更多

OK
客服在線
立即咨詢
日韩人妻系列无码专区视频,先锋高清无码,无码免费视欧非,国精产品一区一区三区无码
客服在線
立即咨詢