期刊名称:EKAIA Euskal Herriko Unibertsitateko Zientzi eta Teknologi Aldizkaria
印刷版ISSN:0214-9001
出版年度:2011
卷号:0
期号:24
DOI:10.1387/ekaia.6822
语种:Basque
出版社:Euskal Herriko Unibertsitatea
摘要:Lan honetan euskarazko ortografia-erroreen azterketa egin dugu webetik jasotako dokumentuekin osatutako hainbat corpusetan (testu-bildumetan), eta horrela corpus horien kalitatea estimatu dugu. Metodologia finkatzeko, ingeleserako eta alemanerako egin den antzeko lanean oinarritu gara (Ringlstetter et al., 2006), baina, euskararen ezaugarriak direla eta, ez dugu teknologia bera erabili erroreak identifikatzeko. Euskarak morfologia aberatsa duenez, erroreak identifikatzeko berrerabili egin ditugu aurretik garatutako ortografia-zuzentzaileak. Bide horretatik, detekzioaren estaldura handiagoa da eta, gainera, prozesuaren garapena azkarragoa izan da berrerabilpena dela-eta. Horrekin batera, posible da ia automatikoki halako tresnak dituzten beste hizkuntzetan metodo bera erabiltzea. Analisiaren emaitzak balio dezake zuzentasunaren araberako testuen sailkapena egiteko, eta bide batez, aukera ematen du gutxieneko kalitate bat ez duten testuak baztertzeko.