Rudarenje podataka
| Tema |
| Mašinsko učenje i rudarenje podataka |
|---|
Rudarenje podataka jeste proces otkrivanja obrazaca u velikim skupovima podataka primjenom metoda iz mašinskog učenja, statistike i sistema baza podataka.[1] Kao interdisciplinarna oblast računarstva i statistike, usmjereno je na izdvajanje informacija iz podataka i njihovo pretvaranje u razumljivu strukturu pogodnu za dalju analizu ili odlučivanje.[2] U užem smislu smatra se analitičkim korakom u procesu otkrivanja znanja u bazama podataka (KDD), dok širi postupak uključuje izbor, pripremu, transformaciju, interpretaciju i provjeru rezultata.[2] Sam izraz ponekad je neprecizan jer cilj nije "iskopavanje" samih podataka, nego izdvajanje obrazaca, zavisnosti i znanja iz velikih količina već prikupljenih podataka.[3]
Metodi i proces
[uredi | uredi izvor]Tipični zadaci obuhvataju klasterizaciju, otkrivanje anomalija, klasifikaciju, regresiju, učenje asocijacijskih pravila i otkrivanje sekvencijalnih obrazaca.[4] Dobijeni obrasci mogu služiti kao sažetak ulaznih podataka, osnova za prediktivnu analitiku ili dio sistema za podršku odlučivanju.[1] Za razliku od klasične analize podataka, koja često provjerava unaprijed postavljenu hipotezu, rudarenje podataka obično traži ranije nepoznate ili skrivene obrasce u velikim količinama podataka.[3] U praksi se često koristi metodologija CRISP-DM, koja razlikuje razumijevanje poslovnog problema, razumijevanje podataka, pripremu podataka, modeliranje, evaluaciju i implementaciju.[5]
Primjena i pitanja
[uredi | uredi izvor]Primjene se javljaju u poslovnoj inteligenciji, marketingu, medicini, bioinformatici, računarskoj sigurnosti, preporučivačkim sistemima i naučnom istraživanju. Veliki obim podataka, automatizirana obrada i mogućnost povezivanja više izvora otvaraju pitanja privatnosti, etike podataka, pristranosti modela, ponovljivosti i tumačenja rezultata.[6]
Reference
[uredi | uredi izvor]- 1 2 Han, Jiawei; Kamber, Micheline; Pei, Jian (2012). Data Mining: Concepts and Techniques (3 izd.). Morgan Kaufmann. ISBN 978-0-12-381479-1.
- 1 2 Fayyad, Usama; Piatetsky-Shapiro, Gregory; Smyth, Padhraic (1996). "From Data Mining to Knowledge Discovery in Databases". AI Magazine. 17 (3): 37–54. doi:10.1609/aimag.v17i3.1230.
- 1 2 Hand, David J.; Mannila, Heikki; Smyth, Padhraic (2001). Principles of Data Mining. MIT Press. ISBN 978-0-262-08290-7.
- ↑ Witten, Ian H.; Frank, Eibe; Hall, Mark A. (2011). Data Mining: Practical Machine Learning Tools and Techniques (3 izd.). Elsevier. ISBN 978-0-12-374856-0.
- ↑ Shearer, Colin (2000). "The CRISP-DM Model: The New Blueprint for Data Mining". Journal of Data Warehousing. 5 (4): 13–22.
- ↑ Kshetri, Nir (2014). "Big data's impact on privacy, security and consumer welfare". Telecommunications Policy. 38 (11): 1134–1145. doi:10.1016/j.telpol.2014.10.002.
Dalje čitanje
[uredi | uredi izvor]- Cabena, Peter; Hadjnian, Pablo; Stadler, Rolf; Verhees, Jaap; Zanasi, Alessandro (1997). Discovering Data Mining: From Concept to Implementation. Prentice Hall. ISBN 0-13-743980-6.
- Chen, Ming-Syan; Han, Jiawei; Yu, Philip S. (1996). "Data mining: an overview from a database perspective". IEEE Transactions on Knowledge and Data Engineering. 8 (6): 866–883. doi:10.1109/69.553155.
- Feldman, Ronen; Sanger, James (2007). The Text Mining Handbook. Cambridge University Press. ISBN 978-0-521-83657-9.
- Guo, Yike; Grossman, Robert, ured. (1999). High Performance Data Mining: Scaling Algorithms, Applications and Systems. Kluwer Academic Publishers. ISBN 978-0-7923-8454-0.
- Han, Jiawei; Kamber, Micheline; Pei, Jian (2006). Data Mining: Concepts and Techniques. Morgan Kaufmann. ISBN 978-1-55860-901-3.
- Hastie, Trevor; Tibshirani, Robert; Friedman, Jerome (2001). The Elements of Statistical Learning: Data Mining, Inference, and Prediction. Springer. ISBN 0-387-95284-5.
- Liu, Bing (2007). Web Data Mining: Exploring Hyperlinks, Contents and Usage Data. Springer. ISBN 3-540-37881-2.
- Murphy, Chris (16. 5. 2011). "Is Data Mining Free Speech?". InformationWeek. str. 12.
- Nisbet, Robert; Elder, John; Miner, Gary (2009). Handbook of Statistical Analysis and Data Mining Applications. Academic Press/Elsevier. ISBN 978-0-12-374765-5.
- Poncelet, Pascal; Masseglia, Florent; Teisseire, Maguelonne, ured. (2007). Data Mining Patterns: New Methods and Applications. Information Science Reference. ISBN 978-1-59904-162-9.
- Tan, Pang-Ning; Steinbach, Michael; Kumar, Vipin (2005). Introduction to Data Mining. Addison-Wesley. ISBN 0-321-32136-7.
- Theodoridis, Sergios; Koutroumbas, Konstantinos (2009). Pattern Recognition (4 izd.). Academic Press. ISBN 978-1-59749-272-0.
- Weiss, Sholom M.; Indurkhya, Nitin (1998). Predictive Data Mining. Morgan Kaufmann. ISBN 978-1-55860-403-2.
- Witten, Ian H.; Frank, Eibe; Hall, Mark A. (30. 1. 2011). Data Mining: Practical Machine Learning Tools and Techniques (3 izd.). Elsevier. ISBN 978-0-12-374856-0.
- Ye, Nong (2003). The Handbook of Data Mining. Mahwah, NJ: Lawrence Erlbaum. ISBN 978-0-8058-4081-0.