Literatur

Details zur Publikation

Im Folgenden sind alle verfügbaren Informationen aufgeführt, die zur gewählten Publikation vorliegen.

van Halteren, HansNelleke Oostdijk (2014). »Variability in Dutch Tweets: An estimate of the proportion of deviant word tokens«. In: Journal for Language Technology and Computational Linguistics, Nr. 29/2. S. 97-123.

ISSN: 21906858

Download der Publikation

Download via Original-URL

Weiterführende Informationen

Abstract: In this paper, we attempt to estimate which proportion of the word tokens in Dutch tweets are not covered by standard resources and can therefore be expected to cause problems for standard NLP applications. We fully annotated and analysed a small pilot corpus. We also used the corpus to calibrate automatic estimation procedures for proportions of non-word tokens and of out-of-vocabulary words, after which we applied these procedures to about 2 billion Dutch tweets. We find that the proportion of possibly problematic tokens is so high (e.g. an estimate of 15% of the words being problematic in the full tweet collection, and the annotated sample with death-threat-related tweets showing problematic words in three out of four tweets) that any NLP application designed/created for standard Dutch can be expected to be seriously hampered in its processing. We suggest a few approaches to alleviate the problem, but none of them will solve the problem completely.

Rezension verfassen

Diese Publikation ist bislang noch nicht rezensiert worden. Sie können die erste Rezension schreiben!

Rezension schreiben

BibTex-Export

Sie möchten die bibliografische Angabe in ein Literaturverwaltungsprogramm oder in LaTeX importieren? Einen BibTex-Datensatz erhalten Sie hier.

Literatur: neue Suche

Geben Sie einen oder mehrere Suchbegriffe ein und schränken Sie bei Bedarf den Bereich ein, in dem gesucht werden soll:

Suchbereich bestimmen:



Suchoptionen:

Ihre Meinung

Kommentare zu dieser Seite