加入收藏 | 设为首页 | 会员中心 | 我要投稿 李大同 (https://www.lidatong.com.cn/)- 科技、建站、经验、云计算、5G、大数据,站长网!
当前位置: 首页 > 综合聚焦 > 服务器 > 安全 > 正文

unix – 使用临时文件vs管道的优点和缺点

发布时间:2020-12-15 18:40:00 所属栏目:安全 来源:网络整理
导读:假设我有一个名为jobs.csv的文件,我想获得Foo完成的前50k工作 我可以这样做: # cat jobs.csv | sort -u | head -n 50000 /tmp/jobs.csv# cat /tmp/jobs.csv | while read line; do Foo --job=$line; done 要么 # cat jobs.csv | sort -u | head -n 50000 |
假设我有一个名为jobs.csv的文件,我想获得Foo完成的前50k工作

我可以这样做:

# cat jobs.csv | sort -u | head -n 50000 > /tmp/jobs.csv
# cat /tmp/jobs.csv | while read line; do Foo --job=$line; done

要么

# cat jobs.csv | sort -u | head -n 50000 | while read line; do Foo --job=$line; done

可以告诉哪一个在系统的IO /内存效率方面更好?

或者甚至更好,可以为此提出更好的解决方案吗?

我通常会选择第二个选项(一直管道),除非其中一个中间输出对我有用.例如,如果在针对50k作业运行Foo之后,您想要针对相同的作业运行Bar,那么使/tmp/jobs.csv可用是有用的.

一直使用管道使系统能够尽早忘记数据,因此可以更有效地使用内存.它还绕过VFS和tmpfs堆栈,因此它使用的CPU略少.链的整体性能也更快,因为在开始下一步之前不需要等待一步完成(除非特定程序需要它).

顺便说一句,在你的例子中,最大的内存用户将是排序阶段,因为它需要将jobs.csv的全部内容保存在内存中以便对其进行排序.您可以通过改进创建jobs.csv的任何内容来提高效率,这样您就不再需要排序-u.

(编辑:李大同)

【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容!

    推荐文章
      热点阅读