發表文章

目前顯示的是有「ptt」標籤的文章

[開源] gossip_gensim 八卦版鄉民斷詞分析

開源的部份請見連結 gossip_genim in github 作法參考 以 gensim 訓練中文詞向量 訓練資料是之前從 ptt 八卦版爬下來的文章及推文,資料範圍大概是 2017年4月下旬發文 及推文的文字內容。 原本爬下來的推文是用來做 ChatBot,希望這 ChatBot 能以鄉民的口吻跟使用者聊天。  使用 python library ChatterBot ,正所謂魔鬼藏在細節裡,當所有詞句都塞進去訓練後,  因為資料量過於龐大(其實我覺得並不多呀~~),反應非常緩慢,一句話要數分鐘才有  反應,嘗試就效能的部份改善這 ChatterBot 專案,還是無功而返,現在就邊走邊看是不是  有更好效能的版本推出囉! 回過頭來,八卦鄉民斷詞分析的結果還是來看一下吧! 這裡的示範就不要跟 github 一樣,來看看有什麼好玩的。 道德感 相似詞前 10 排序 鄉願,0.9327921271324158 出於,0.9301384091377258 半斤八兩,0.9297078251838684 不同於,0.9280074834823608 大開眼界,0.9261846542358398 不一,0.9260203242301941 情意,0.923358678817749 人們,0.9223132133483887 身處,0.9210435748100281 字詞,0.9183312058448792 ---------------------------- 情意 相似詞前 10 排序 特質,0.9544895887374878 出於,0.9533513784408569 抨擊,0.9482460618019104 世俗,0.9448075294494629 無論是,0.9444169402122498 這裡面,0.9436346888542175 Bl,0.943479061126709 得以,0.9434195160865784 一代宗師,0.9433241486549377 邏輯性,0.940061092376709 ---------------------------- 流動 相似詞前 10 排序 情慾,0.8976155519485474 憧憬,0.883830547332...

Use PTT to track your friends' sleeping habits

00:02:08 不在站上 最近無新信件 23:18:21 123.195.xx.xx 08:26:11 閱讀文章 最近無新信件 08:22:36 111.70 .xx.xx 09:00:14 閱讀文章 最近無新信件 08:54:48 111.70 .xx.xx 10:36:14 不在站上 最近無新信件 08:54:48 111.70 .xx.xx 14:04:11 閱讀文章 最近無新信件 13:58:08 140.136 .xx.xx 14:47:15 閱讀文章 最近無新信件 14:44:02 140.136 .xx.xx 15:31:08 不在站上 最近無新信件 14:44:02 140.136 .xx.xx   (隱藏部份資訊) 上面的資訊是之前用 expect 為主體完成的練習題,自動登入 ptt、查詢某位網友的動態、上線時間、ip等資料,再進行資料整理的結果。 利用這些資料,進一步想知道這 ip 的來源,ip 是誰發放的,如果是學術網路的話,又是那一所學校呢? 要完成上述的事項,需要幾個功能。 1. 查詢 ip 發放單位 2. 學術網路各學校的ip分配 指令如下 catptt 1|awk -F ' ' '{print $5}'|sort|uniq|while read x; do  echo $x; whois $x; done  whois 是自己寫的一個功能,可以查到發放單位及是學術網路的哪個學校的ip catptt 也是自己寫的,用來顯示每天所收集的資料, 後面參數 1 指的是昨天的資料 以下是 linux 指令 awk: 用來切字串的工具 (好用、推) (awk -F ' ' '{print $5}' 意思是用空白當切割符號,並印出第五個元素) sort: 排序資料行 uniq:利用排序過的資料,將重複的資料去除 while read x; do echo $x;whois $x; done 針對每一資料行,顯示 ip 並做 whois 查詢 結果如下 111.70.xx.xx 中華電信股份有限公司 1.168.xx.xx 中華電信股份有限公司 123.195.xx.xx 凱擘股份有限公司 140.136.x...