2015年5月24日 星期日

Frequent itemset (Aprori, FP-growth, sequential patternsㄎ

這些演算法

都是希望能在資料群中找出常發生的資料


1. Aprori

非常耗時間,但直覺且簡單



2. FP growth


(1) 不錯的slide
http://www.slideshare.net/deepti92pawar/the-comparative-study-of-apriori-and-fpgrowth-algorithm



3. Tree projection algorithm - lexicographical tree


4. PROPAD algorithm


整個演算法大致為前三步驟循環
(1)建立transaction/tempory itemset
(2)由上建立frequent itemset table
(3)由上建立projected transaction table
(4)以上面table中的點,從(1)開始繼續
(5)建立frequent set tree

ex.



(1) 可以參考這篇paper
Depth-First Frequent Itemset Mining in RelationalDatabases




4. ECLAT algorithm

不同transaction但同樣的element以自己的TID作為標記,放在一起

再利用merge的方式,即可快速得到support counting,而不必搜尋全部資料




---------------------------------------------------------------------------------


3. Sequential patterns (data stream mining)


(1) Maxspan constraint: 以最大時間來限制可考慮的資料範圍,會影響support counting 的值

(2) Maxgap and Mingap constraint: 跟上面方法很類似,但同時考慮最大和最小範圍,一樣會影響support counting 的值。

但要注意的是

若是採用這些限制可能影響Aprori演算法中,subsequence 一定也是frequent itemset

因此有新的modified Aprori Principle判斷法則

就是只考慮同樣指符合時間限制的subsequence

ex.

<1,3,5> 的 subsequence 可以有 <1,3>, <1,5>, <3,5>

但若限制 maxgap = 1

則subsequence只考慮 <1,3>, <3,5>

Cluster method (DBSCAN, K-means), cluster tendency, cluster validity

1. Method of classification

(1)DBSCAN :
優點 可以解決資料不規則分佈(歪七扭八參雜)

(2)K-means
缺點 不能解決不規則分佈資料

1. 隨機在空間中放下K點為中心點
2. 利用 Vironoi diagram 和中心點,將空間的所有點分成數個區塊
3. 計算區塊中所有點的平均值,將中心點移至那裡
4. 重複第2步驟,直至收斂


(3) MAX- distance

(4) MIN- distance




(1) 中文講解不同區分法k-means, DBSCAN
http://123android.blogspot.se/2012/01/28dec11-data-mining.html 

(2) wiki 演算法講解滿清楚
http://en.wikipedia.org/wiki/DBSCAN


-----------------------------------------------------------------------------



2. Cluster tendency

在我們真的去用演算法劃分cluster前

其實可以先借由一些方法來得知資料的分佈狀況

像是『平均分佈』或是『集中分佈』方式


ex. Hopkins statistic演算法


p 為資料空間中任意挑選的點,可以參雜真正的資料點
ui 為p點到彼此最近的點的距離
wi 為p點到最近的真正資料點的距離

從H值可以粗估一些狀況
-  接近0.5, 資料為平均分佈在空間中
-  接近1, 資料高度集中


-----------------------------------------------------------------------------



3. Cluster validity

在我們利用不同方法將資料區分成不同cluster之後

總得去分析這些方法的是否可行

下面就是幾種最為參考的數值




舉個例  
Ex.


Entropy 和 Purity 可以參考上表

但若考慮cluster 1 內

對於Metro 的 Precision = 506/667 = 0.75

對於Metro 的 Recall = 506/943 = 0.26

所以cluster 1 的 Metro 的 F measure = 2*0.75*0.26/(0.75+0.26) = 0.39




2015年5月20日 星期三

Web mining algorithm (HITS, PageRank)

1. HITS


(1) 起始化hub和authority 的值為1
(2) 計劃 Authority,  a = At * h
(3) 計算 Hub,  h = A * a
(4) 正規化 Authority 和 Hub
(5) 重複2-4的動作,直到收斂

!? a = AtA*h
!? h = AAt*a


----
[1] http://sls.weco.net/node/10937
[2] http://www.math.cornell.edu/~mec/Winter2009/RalucaRemus/Lecture4/lecture4.html
[3] http://en.wikipedia.org/wiki/HITS_algorithm#Normalization



2. Pagerank


可以分成迭代法(Iteration)和代數法(algebra)來計算得到結果

(1) 不同範例,且有小程式可計算測試
http://www.webworkshop.net/pagerank.html#toolbar_pagerank

(2) 公式推導
http://mathscinotes.com/2012/01/worked-pagerank-example/

(3) 起始值推敲說明
http://www.sirgroane.net/google-page-rank/

(4)兩種算法解說
http://www.math.cornell.edu/~mec/Winter2009/RalucaRemus/Lecture3/lecture3.html

2015年2月9日 星期一

學習清單

在這裡放一些學習清單


1. http://pcgeeks.bugs3.com/?p=429
自動連上網路的方式

2. http://stackenblochen.blogsport.eu/2013/03/26/script-to-automatically-login-to-upunet-s-at-uppsala-university/
連上網頁的腳本

2014年6月11日 星期三

[Seminar]The regularity Genomics in the Era of Next-Generation Sequencing-蔡宗曄博士

        這次的講座,讓我有種回到高中時期重心複習生物的感覺。我一直對於生物有很深的興趣,儘管現在念的是資訊科技,還是希望有一天能重拾當年的熱誠,將兩者做結合。

我以前念到基因的課程時,就一直有個疑問,身體所有細胞的基因都是一樣的,到底是什麼東西控制他要在哪裡開啟基因的開關,讓他化成所要的細胞呢,看來今天的演講給了我一個很好的答案。基因最小的成分是由GCAT所組成的,經過一些蛋白質的纏繞再纏繞後,才是我們所熟知的染色體。而這些被包裹的蛋白質身上有著許多受器,他們所接受到的不同外來因子,都會導致基因鬆緊度的不同,進而影響不同基因的顯現情況。舉個講師所講的例子,要讓基因發出功能,就得有對的鑰匙對上對的鑰匙孔,若是基因被纏地太緊,鑰匙孔就會被堵住,所以就沒辦法顯現嘍。但那些基因中,不是全部都代表著遺傳資訊,反而只有2%而已,至於其他的98%都是控制資訊,控制轉錄和轉譯等等因素。

前面那些都只是基本介紹,講師還提了許多做過的實驗。在DNA的轉錄過程中,會牽涉一種因子,叫做itf,他能不能順利進行,就會影響最後蛋白質產量的多寡,經過他們的實驗結果,主要因素是主蛋白、DNA結構和鍵結的能量等因素。


其實今天這場演講還介紹很多,不僅重新喚起了我對生物的那份興趣,也給我了一個應用的方向。

2014年6月4日 星期三

[Seminar] 台灣代工產業及目前最新的產業趨勢-郭柳宗業務處長

        今天的講座讓我大開眼界,對於畢業後要怎樣找工作,有了很清楚地概念。講師之前在業界待了非常久的時間,尤其是在鴻海,待過許多部門,從RDPMsales都有一段經歷,也因為如此,他介紹了我們一進公司後要怎樣磨練自己,如何從RD一路發展上去。但是,不同的部門還是得仔細的考慮是否適合自己,自己的個性和能力是不是能在那個位子發揮最大功用?
另外,一個公司的文化,也是我們選擇公司的首要條件,想要一間嚴苛的公司或是一間相對壓力較低的全取決於自己,當然嚴苛的公司一般薪水都會較多,我想這會是我一個很大的誘因。
台灣身為代工龍頭,很驕傲但我覺得也很可悲,只能拿到一個產品微乎其微的毛利率,原因完全取決於設計部分不是我們所做的,難道我們沒有這樣的人才嗎,我想我應該好好想想,如何充實這些能力,讓台灣能在這方面蓬勃發展。另外設計也取決於創新能力,我們只會一味的做重複的事情,而不懂得研究和想像,確實害得我們只能這樣,不知道台灣要再教育上如何的改進,才能讓我們更具以這些創新的技巧和充實自己的正確態度。

2014年5月28日 星期三

[Seminar]Sensing Objects semantics for interactive Multimedia Application-鄭文皇教授

          今天的演講真的非常有趣,有別於以前幾乎都在講技術層面,這次多是在講如何應用,感覺起來輕鬆許多,也更貼近生活。這次主題是有關多媒體影像技術與生活上的結合,最有名的例子就是google glass,利用隨身攜帶的裝置讀取身邊影像,再即時辨識影像來原,像是所在的位置或是物品名稱。根據這些資料,他就能間接的告訴你附近有哪些資訊,像是景點、餐廳或是商店等等,讓我們不需要再打開手機搜尋,非常方便。另外,一張死死的照片或畫作,對我們來說,可能毫無趣味性,如果我們能像哈利波特一樣,讓照片自己訴說出他的故事,不是更生動也更直接嗎?他提到倫敦博物館最近出了一款App,能夠將博物館裡所收集到以前的街景照片,結合人們手機所拍到的街景,讓我們能直接體驗眼前的場景在以前所發生的點點滴滴,真是有趣極了。
為什麼要大大的結合影像技術,我覺得最主要的原因,是他更接近了我們眼睛所看的和身體所感受的互動,不再是一堆指令或是滑鼠鍵盤的點擊,如果以後能夠看不到任何一點機器,就能體驗這些互動那就最棒的結果了吧。