首页 > 其他 > 详细

统计英文文档频率前n单词

时间:2017-07-14 19:23:55      阅读:272      评论:0      收藏:0      [点我收藏+]
#coding:utf-8
#!/usr/bin/python2.6


def statistic_eng_text():
    ‘‘‘统计出英文文档中高频词汇‘‘‘
    cnt = Counter()
    np = os.path.join(get_project_path(),‘doc‘,‘jack lodon.txt‘)
    ff = open(np,‘r‘)
    words = ff.read()
    format_text = re.split(‘[\s\ \\,\;\.\!\n]+‘,words)

    for w in format_text:#比较的时候注意了大小写,其中有一个 the是以大写字母开始的,所以在notepad中统计出来了,而在代码中没有统计出来

        cnt[w.lower()] += 1#这里需要把单词进行一个转换,避免大小写导致的不匹配
    print cnt.most_common(5)

if __name__ == ‘__main__‘:
    statistic_eng_text()

  

统计英文文档频率前n单词

原文:http://www.cnblogs.com/yNds/p/7171870.html

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!