- 链接地址:https://blog.csdn.net/iteye_10664/article/details/82086732
- 链接标题:常见的海量数据处理方法-CSDN博客
- 所属网站:blog.csdn.net
- 被收藏次数:5039
文章浏览阅读810次。1. 给定a、b两个文件,各存放50亿个url,每个url各占64字节,内存限制是4G,让你找出a、b文件共同的url?方案1:可以估计每个文件安的大小为50G×64=320G,远远大于内存限制的4G。所以不可能将其完全加载到内存中处理。考虑采取分而治之的方法。s 遍历文件a,对每个url求取 ,然后根据所取得的值将url分别存储到1000个小文件(记为 )中。这样每个小文件的大约为300..._有一个超级大的文本文件,其中每行是一个用户名(长度不超过200)。请设计一种算法,
版权声明:本文发布于特牛网址导航 内容均来源于互联网 如有侵权联系删除