Lupa

Izpis gradiva Pomoč

A- | A+ | Natisni
Naslov:UzbekPOS : a multi-domain dataset for Uzbek part-of-speech tagging
Avtorji:ID Sharipov, Maksud (Avtor)
ID Kuriyozov, Elmurod (Avtor)
ID Vičič, Jernej (Avtor)
Datoteke:.pdf RAZ_Sharipov_Maksud_2026.pdf (787,49 KB)
MD5: 0CCF384767E7ADC9CF5239718D55BA63
 
URL https://www.sciencedirect.com/science/article/pii/S2352340926001939?via%3Dihub
 
Jezik:Angleški jezik
Vrsta gradiva:Članek v reviji
Tipologija:1.01 - Izvirni znanstveni članek
Organizacija:FAMNIT - Fakulteta za matematiko, naravoslovje in informacijske tehnologije
Opis:In this paper, we introduce UzbekPOS — a part-of-speech (POS) tagged dataset manually annotated for the Uzbek language, designed for natural language processing, artificial intelligence models, and corpus linguistics applications. This tagged corpus is currently the largest publicly available POS- tagged corpus for the Uzbek language. The dataset comprises sentences drawn from a diverse range of Uzbek text sources, including literature, news outlets, science, education, and public speaking, to reflect linguistic and topical diversity. The sentences are tokenized and annotated by professional annotators, utilizing a finely grained POS tagset which integrates standard Universal Dependencies with additional labels that are specific to the morphological and syntactic features of the Uzbek language, comprising 16 tags in total. The UzbekPOS contains almost 4.5K sentences and more than 53K token/tag pairs, with each annotation cross-verified by at least two annotators for highest reliability. It also comes with both raw (txt) and generally accepted formats of distribution (TSV, JSON), as well as the universal POS-tagging format (conllu). This resource is one of the first and the largest openly published POS-tagged dataset for Uzbek, an under-resourced and morphologically complex Turkic language. This dataset can also act as a key foundation for training POS taggers, as a test set for machine learning models, and as a source for linguistic studies. The resource also bears the reusability potential for tasks of related kinds, such as morphological analysis, syntactic parsing, and transfer learning across languages of the Turkic family. Furthermore, this dataset can serve as seed material for creating similar corpora of POS for other Turkic languages and can help conduct cross-linguistic analyses and tool building.
Ključne besede:POS tagging, Uzbek language, morphological annotation, natural language processing
Verzija publikacije:Objavljena publikacija
Datum objave:28.02.2026
Leto izida:2026
Št. strani:str. 1-10
Številčenje:Vol. 66, article 112640
PID:20.500.12556/RUP-23571 Povezava se odpre v novem oknu
UDK:004.65:811.5
ISSN pri članku:2352-3409
DOI:10.1016/j.dib.2026.112640 Povezava se odpre v novem oknu
COBISS.SI-ID:270694915 Povezava se odpre v novem oknu
Datum objave v RUP:08.09.2026
Število ogledov:57
Število prenosov:2
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
  
Skupna ocena:(0 glasov)
Vaša ocena:Ocenjevanje je dovoljeno samo prijavljenim uporabnikom.
Objavi na:Bookmark and Share


Postavite miškin kazalec na naslov za izpis povzetka. Klik na naslov izpiše podrobnosti ali sproži prenos.

Gradivo je del revije

Naslov:Data in brief
Založnik:Elsevier
ISSN:2352-3409
COBISS.SI-ID:32117977 Povezava se odpre v novem oknu

Licence

Licenca:CC BY 4.0, Creative Commons Priznanje avtorstva 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by/4.0/deed.sl
Opis:To je standardna licenca Creative Commons, ki daje uporabnikom največ možnosti za nadaljnjo uporabo dela, pri čemer morajo navesti avtorja.

Sekundarni jezik

Jezik:Slovenski jezik
Opis:V tem članku predstavljamo UzbekPOS – nabor podatkov, označen z vrstami govora (POS), ki je ročno označen za uzbeški jezik in je zasnovan za obdelavo naravnega jezika, modele umetne inteligence in aplikacije korpusnega jezikoslovja. Ta označeni korpus je trenutno največji javno dostopni korpus z oznakami POS za uzbeški jezik. Nabor podatkov vsebuje stavke, vzete iz raznolikih uzbeških besedilnih virov, vključno z literaturo, novicami, znanostjo, izobraževanjem in javnim nastopanjem, da bi odražali jezikovno in tematsko raznolikost. Stavke žetonizirajo in označujejo profesionalni anotatorji z uporabo natančno zrnatega nabora oznak POS, ki združuje standardne univerzalne odvisnosti z dodatnimi oznakami, značilnimi za morfološke in sintaktične značilnosti uzbeškega jezika, skupaj pa obsega 16 oznak. UzbekPOS vsebuje skoraj 4,5 tisoč stavkov in več kot 53 tisoč parov žetonov/oznak, pri čemer vsako opombo navzkrižno preverita vsaj dva anotatorja za najvišjo zanesljivost. Na voljo je tudi v surovi (txt) in splošno sprejeti obliki distribucije (TSV, JSON) ter v univerzalni obliki označevanja POS (conllu). Ta vir je eden prvih in največjih odprto objavljenih naborov podatkov z oznakami POS za uzbeščino, turški jezik s premalo viri in morfološko kompleksnimi viri. Ta nabor podatkov lahko služi tudi kot ključna osnova za usposabljanje označevalcev POS, kot testni nabor za modele strojnega učenja in kot vir za jezikoslovne študije. Vir ima tudi potencial ponovne uporabe za naloge sorodnih vrst, kot so morfološka analiza, sintaktično razčlenjevanje in prenos učenja med jeziki turške družine. Poleg tega lahko ta nabor podatkov služi kot začetni material za ustvarjanje podobnih korpusov POS za druge turške jezike in lahko pomaga pri izvajanju medjezikovnih analiz in gradnji orodij.
Ključne besede:označevanje POS, uzbeški jezik, morfološka anotacija, obdelava naravnega jezika


Komentarji

Dodaj komentar

Za komentiranje se morate prijaviti.

Komentarji (0)
0 - 0 / 0
 
Ni komentarjev!

Nazaj
Logotipi partnerjev Univerza v Mariboru Univerza v Ljubljani Univerza na Primorskem Univerza v Novi Gorici