当前位置:首页 > 开发 > 编程语言 > Python > 正文

Life is short, use python.

发表于: 2014-09-28   作者:cutesunshineriver   来源:转载   浏览:
摘要: 前一阵子看书《Head First Python》学了一下Python,最近在实践中又小试了一把,某些场景用起来确实很爽。 我有一个100M的CSV文件,记录数在120万行左右。 单条记录如下: 211.136.115.11|www.baidu.com|20130228105956|119.75.218.77;119.75.217.56|0 我想找出这个文件里排名前10的域名。 下面
前一阵子看书《Head First Python》学了一下Python,最近在实践中又小试了一把,某些场景用起来确实很爽。

我有一个100M的CSV文件,记录数在120万行左右。
单条记录如下:
211.136.115.11|www.baidu.com|20130228105956|119.75.218.77;119.75.217.56|0
我想找出这个文件里排名前10的域名。
下面是华丽丽的Python代码:
# coding=utf-8
import csv
import datetime

filename = "E:/220_01_20130228100039.txt"
rownum = 0  # 文件行号
rank = 10  # 排名数
result = dict()

start = datetime.datetime.now()
with open(filename, 'rU', encoding="utf-8", errors='ignore') as csvfile:
    reader = csv.reader(csvfile, delimiter="|")
    for line in reader:
        rownum += 1
        
        if len(line) < 1:  # 空行
            continue
        elif len(line) < 2:
            print("错误行号:" + str(rownum))
            continue
        elif result.get(line[1], None) is None:
            result[line[1]] = 1
        else:
            result[line[1]] += 1
print("~~~~~~~~~~~~~~~~~~~~~~~~")
print("域名数:" + str(len(result)))
count = rank
result = sorted(result.items(), key=lambda d:d[1], reverse=True)
for item in result:
    count -= 1
    print("排名" + str(rank - count) + ":" + str(item))
    if count == 0:
        break;
end = datetime.datetime.now()
print("耗时:" + str(end - start))

35行代码搞定,如果换成java,估摸着要60行上下了。

从5万多个域名里找出前十,3个是QQ域名,2个是Google域名,2个是baidu域名,1个是apple域名,1个是新浪微博,还有1个居然是移动广告的flurry。

哪天有时间,可以尝试用shell来写。

Life is short, use python.

  • 0

    开心

    开心

  • 0

    板砖

    板砖

  • 0

    感动

    感动

  • 0

    有用

    有用

  • 0

    疑问

    疑问

  • 0

    难过

    难过

  • 0

    无聊

    无聊

  • 0

    震惊

    震惊

版权所有 IT知识库 CopyRight © 2009-2015 IT知识库 IT610.com , All Rights Reserved. 京ICP备09083238号