User Guide
Why can I only view 3 results?
You can also view all results when you are connected from the network of member institutions only. For non-member institutions, we are opening a 1-month free trial version if institution officials apply.
So many results that aren't mine?
References in many bibliographies are sometimes referred to as "Surname, I", so the citations of academics whose Surname and initials are the same may occasionally interfere. This problem is often the case with citation indexes all over the world.
How can I see only citations to my article?
After searching the name of your article, you can see the references to the article you selected as soon as you click on the details section.
  Citation Number 10
 Views 19
 Downloands 2
TF-IDF ve Doc2Vec Tabanlı Türkçe Metin Sınıflandırma Sisteminin Başarım Değerinin Ardışık Kelime Grubu Tespiti ile Arttırılması
2021
Journal:  
Avrupa Bilim ve Teknoloji Dergisi
Author:  
Abstract:

TF-IDF terim ağırlıklandırma ölçümü kelimelerin metinler içinde geçme sıklığı bilgisine dayalıdır. Bu ölçüm kelimeler arasındaki anlamsal ilişkiyi barındırmamaktadır. Yapay sinir ağlarına dayalı olan Doc2Vec metodu kelimeler ve kelimeleri içeren dokümanlar arasındaki anlamsal ilişkiyi barındırmakta ve yönetilebilir boyutlu doküman vektörlerinin elde edilmesini sağlamaktadır. Ardışık kelime gurubu tespitinin metin madenciliği üzerindeki olumlu etkileri literatürde sunulan pek çok çalışma tarafından belirtilmiştir. Ardışık kelime gurubu tespiti doküman içindeki anlamsal bütünlüğün sağlanması açısından önemlidir. Bu çalışmada, hem geleneksel TF-IDF terim ağırlıklandırma ölçümünün, hem de YSA’lara dayalı bir yöntem olan Doc2Vec yönteminin kullanımı ile vektörleştirilen dokümanlar üzerinde temel makine öğrenmesi sınıflandırıcılarının ve topluluk öğrenmesi algoritmalarının başarım değerleri kıyaslanmıştır. Çalışmamızda temel sınıflandırıclar olarak Naive Bayes, K-En yakın komşuluk, Lojistik Regresyon, Karar Destek Makineleri, Karar Ağaçları, Çok Katmanlı Algılayıcılar ve topluluk öğrenmesi metotlarından Rassal Orman, Torbalama ve Adaboost algoritmaları kullanılmıştır. Ayrıca son olarak en başarılı üç sınıflandırma algoritması Çoğunluk oylaması ile birleştirilmiş ve elde edilen sonuçlar paylaşılmıştır. Sınıflandırıcılar farklı uzunluklarda haber dokümanlarını içeren 4 farklı Türkçe veri kümesi üzerinde uygulanmıştır. Çalışmamızın literatüre olan katkısı sınıflandırma aşamasına geçilmeden önce dokümanların içindeki ardışık kelime grubu tespitinin gerçekleştirilmesi ve dokümanların bu kelime öbeklerinin tek bir kelime gibi ele alınmasıyla vektörleştirildikten sonra, uygulanan sınıflandırıcıların başarım değerlerinin arttığının gösterilmesi olmuştur. Ardışık kelime grubu tespiti için kelimelerin birlikte geçme sıklığı prensibine dayalı olan bir prensip dışında, Türkçe Vikipedi’nin kelime bağlantıları da kullanılmış ve dokümanlar içinde az sayıda geçmesine rağmen anlamlı olan ardışık kelime öbeklerinin tespiti gerçekleştirilebilmiştir. Ardışık kelime grubu tespiti ile sınıflandırma deneylerinin hemen hemen tümünde daha yüksek başarım değerleri elde edilmiştir.

Keywords:

TF-IDF and Doc2Vec-based Turkish Text Classification System Increases Success Value by Continuous Word Group Detection
2021
Author:  
Abstract:

TF-IDF term weighting measurement is based on the knowledge of the frequency of words passing in texts. This measurement does not contain the meaningful relationship between the words. Based on artificial nerve networks, the Doc2Vec method hosts the meaningful relationship between words and words-containing documents and ensures the achievement of managed-dimensional document vectors. The positive effects of followed word group detection on text mining have been pointed out by many studies presented in literature. Identification of the consistent word group is important for ensuring the meaningful integrity within the document. This study compared the success values of both the traditional TF-IDF term weighting measurement and the basic machine learning classificers and community learning algorithms on the documents vectored by the use of the Doc2Vec method, a method based on YSA. The main classifiers in our study were Naive Bayes, K-Last Neighborhood, Logistics Regression, Decision Support Machines, Decision Tree, Multi-Last Detectors and Community Learning Methods using Rassal Forest, Torbalama and Adaboost algorithms. Also the last three most successful classification algorithms combined with the majority vote and the results obtained were shared. Classifiers have been applied on 4 different Turkish datasets containing news documents in different lengths. Before the contribution of our work to literature was passed to the classification phase, the realization of the sequential word group in the documents and after the document was vectored by the treatment of these word subjects as a single word, it was shown that the success values of the classifiers applied increased. In addition to a principle that is based on the principle of the frequency of passing together of words for the detection of the follow-up word group, the word links of the Turkish Wikipedia have also been used and the detection of the follow-up word subjects, which are meaningful despite the small number of passing in the documents, has been made possible. With consistent word group detection, higher success values have been achieved in almost all of the classification trials.

Keywords:

Enhancing The Performance Of Tf-idf and Doc2vec Based Turkish Text Categorization System With Phrase Modeling
2021
Author:  
Abstract:

TF-IDF term weighting measure is based on frequency of words in texts. This measure doesn’t capture the semantic relationship between words. Doc2Vec which is based on artificial neural networks can capture the semantic relations between the words and it enables to yield document vectors of a more manageable size. Consecutive word detection has been reported to have important effects on text mining by many studies. Consecutive word phrases are important for expressing the semantic integrity within the texts. In this study, the performances of traditional machine learning classifiers and ensemble learning algorithms are compared on four different Turkish datasets which are vectorized with both traditional TF-IDF term weighting measurement and Doc2Vec method. The classifiers have been applied on 4 different Turkish datasets containing news documents of different lengths. The contributions of our study are “to apply consecutive word detection process to the documents before the classification phase” and “to show that the performances of the applied classifiers’ results have been increased after the consecutive word detection phase is applied”. In addition to the approach based on frequency of words for consecutive word detection, we also use the url links of Turkish Wikipedia. By using consecutive word detection, higher performance values are presented in almost all classification experiments.

Citation Owners
Attention!
To view citations of publications, you must access Sobiad from a Member University Network. You can contact the Library and Documentation Department for our institution to become a member of Sobiad.
Off-Campus Access
If you are affiliated with a Sobiad Subscriber organization, you can use Login Panel for external access. You can easily sign up and log in with your corporate e-mail address.
Similar Articles








Avrupa Bilim ve Teknoloji Dergisi

Field :   Fen Bilimleri ve Matematik; Mühendislik

Journal Type :   Uluslararası

Metrics
Article : 3.175
Cite : 5.550
2023 Impact : 0.178
Avrupa Bilim ve Teknoloji Dergisi