国内刊号:43-1258/TP
国际刊号:1007-130X
发布日期:
作者:陈侨安1,李峰1,曹越1,龙明盛1,2
单位:1.清华大学软件学院,北京 100084;2.清华大学信息科学与技术国家实验室(筹),北京 100084
关键词:大数据,运行数据,数据分析,参数优化,Spark,
基金:清华大学信息科学与技术国家实验室大数据科学与技术专项(面向领域的大数据应用系统开发与运行平台)
运行数据是大数据系统中增长最快、最为复杂也是最有价值的数据资源之一。基于运行数据,软件开发者可以分析关于软件质量和开发模型的重要信息。Spark作为一个分布式系统,在运行过程中会产生大量的运行数据,包括日志数据、监控数据以及任务图数据。开发者可以基于运行数据对系统进行参数调优。然而该系统所涉及的参数种类繁多、影响多样且难以评估,若对系统了解不足,进行参数调优存在较大的困难。提出运行数据历史库的概念,历史库中存储的是以往运行任务的特征信息以及运行配置信息。同时提出了基于历史库搜索的参数优化模型,并实验验证了本文提出的参数优化模型对用户任务性能提升具有较好的效果。
来源:2016年第1期
《计算机工程与科学》期刊编辑部