首页    期刊浏览 2024年12月02日 星期一
登录注册

文章基本信息

  • 标题:Investigation of the abilities of data mining systems to analyse various volume datasets
  • 其他标题:Duomenų tyrybos sistemų galimybių tyrimas įvairių apimčių duomenims analizuoti
  • 本地全文:下载
  • 作者:Kotryna Paulauskienė ; Olga Kurasova
  • 期刊名称:Informacijos Mokslai
  • 印刷版ISSN:1392-0561
  • 电子版ISSN:1392-1487
  • 出版年度:2013
  • 卷号:65
  • 页码:85-95
  • DOI:10.15388/Im.2013.0.2052
  • 语种:English
  • 出版社:Vilnius University Press
  • 摘要:The aim of the paper is to determine what volume of data the popular data mining systems are able to analyse within a reasonable period of time,when solving classifi cation and clustering problems. Three open source data mining systems are investigated: WEKA,KNIME,and ORANGE. The experiments have been carried out with eight datasets,where the number of attributes was fi xed – 100 and the number of instances ranged between 5000 and 600 000. The experimental investigation has shown that when the ORANGE system is used,the data of more than 50 000 instances are of too large volume. In order to analyse larger datasets,the WEKA and KNIME systems need to be used. The data of more than 200 000 instances are of too large volume for WEKA and KNIME,however,when simple classifi cation methods are used,both systems are able to handle 400 000 instances,and KNIME – 600 000 instances. The results have showed that KNIME can handle larger datasets than WEKA,when applying some classifi cation methods. The accuracy of classifi cation is high enough,when the classifi cation methods,implemented in the systems,are used.
  • 其他摘要:Tobulėjant šiuolaikinėms informacinėms ir komunikacinėms technologijoms,sparčiai didėja apdorojamų ir saugomų duomenų kiekiai,todėl duomenų analizės uždavinys tampa vis sudėtingesnis,sunku daryti greitus,efektyvius ir teisingus sprendimus. Duomenų analizei dažnai pasitelkiama duomenų tyryba. Duomenų tyryba – tai procesas,kurio metu iš duomenų išgaunamos naudingos žinios. Duomenims apdoroti bei žinioms išgauti reikalingos duomenų tyrybos sistemos,leidžiančios apdoroti įvairios apimties duomenis. Tyrime siekiama nustatyti,kokios apimties duomenis per priimtiną laiką sugeba apdoroti populiariausios duomenų tyrybos sistemos. Nagrinėjamas ir lyginamas trijose atvirojo kodo duomenų tyrybos sistemose (WEKA,KNIME,ORANGE) įgyvendintų klasifi kavimo ir klasterizavimo algoritmų skaičiavimo laikas,analizuojant skirtingos apimties duomenų aibes. Vertinant sistemas svarbus ne tik algoritmų skaičiavimo laikas,bet ir klasifi kavimo bei klasterizavimo tikslumas,kurį pavyksta pasiekti per tą laiką,todėl straipsnyje pateikiamos ir eksperimentiniuose tyrimuose gauto tikslumo matų reikšmės.
国家哲学社会科学文献中心版权所有