Wie wird der Prozess bezeichnet, bei dem Muster und Erkenntnisse aus unstrukturierten Textdaten identifiziert werden?
Text-Mining (oder Textanalyse)
Welche zentrale Komponente des Text-Mining befasst sich mit der maschinellen Verarbeitung natürlicher Sprache?
Natural Language Processing (NLP)
Was versteht man in der Textanalyse unter einem 'Korpus'?
Eine Sammlung von geschriebenen Texten oder Dokumenten zur Analyse.
Welcher Schritt der Textvorverarbeitung zerlegt eine Zeichenkette in kleinere Einheiten wie Wörter oder Zeichen?
Tokenisierung
Wie nennt man Wörter wie Artikel oder Pronomen, die in der Vorverarbeitungsphase meist herausgefiltert werden?
Stoppwörter
Was ist das Ziel des 'Stemming' (Stammformreduktion)?
Das Entfernen von Wortendungen, um den Wortstamm zu isolieren.
Warum gilt die Lemmatisierung im Vergleich zum Stemming als präziser?
Weil sie auf der Bedeutung des Wortes basiert und Flexionsendungen zur Grundform (Lemma) führt.
In welches Format müssen Texte transformiert werden, um Analysen des maschinellen Lernens durchzuführen?
In numerische Darstellungen (Vektoren).
Wie wird der Prozess genannt, Informationen wie Länge, Quelle oder Veröffentlichungsdatum aus einem Text zu ziehen?
Merkmalsextraktion (Feature Extraction)
Welches Modell stellt die Anzahl der Wörter eines Dokuments in vektorieller Form dar, ohne die Reihenfolge zu berücksichtigen?
Bag-of-Words (BoW)
Was beschreibt der 'semantische Raum' in Bezug auf Textdokumente?
Ein mehrdimensionaler Raum, in dem Dokumente als Punkte dargestellt werden und räumliche Nähe Ähnlichkeit bedeutet.
Wie beeinflusst die Dokumentenähnlichkeit die Position der Punkte im semantischen Raum?
Je ähnlicher die Bedeutung der Dokumente, desto näher liegen ihre Punkte beieinander.
Welche Information geht bei der Verwendung eines Bag-of-Words-Modells verloren?
Die Struktur und die Reihenfolge der Wörter im Satz.
Warum werden Vektoren im Bag-of-Words-Modell oft als 'dünnbesetzt' (sparse) bezeichnet?
Weil sie viele Nullen enthalten, da ein einzelnes Dokument nur einen Bruchteil des Gesamtvokabulars nutzt.
Welchen Vorteil bietet die Verwendung von Bigrammen (2-Grammen) gegenüber einfachen Wörtern?
Sie können Wortgruppen (z. B. 'Online-Verbindung') erfassen, die zusammen eine spezifische Bedeutung haben.
Was bedeutet die Abkürzung TF-IDF?
Term Frequency-Inverse Document Frequency
Was misst die inverse Dokumentenhäufigkeit (IDF)?
Die Relevanz bzw. Seltenheit eines Wortes über die gesamte Dokumentensammlung hinweg.
Welche zwei Komponenten werden multipliziert, um das TF−IDF-Maß zu erhalten?
Die Termhäufigkeit (TF) und die inverse Dokumentenhäufigkeit (IDF).
Worauf konzentriert sich die semantische Analyse im Gegensatz zur lexikalischen Analyse?
Auf größere Textstücke und die Beziehungen zwischen Wörtern, um die Bedeutung zu interpretieren.
Welche Methode hilft dabei, abstrakte Themen in großen Mengen von Textdaten zu entdecken?
Themenmodellierung (Topic Modeling)
Was ist die Grundannahme der 'Latenten Semantischen Analyse' (LSA)?
Dass Wörter mit ähnlicher Bedeutung in ähnlichen Textabschnitten vorkommen (Verteilungshypothese).
Welches mathematische Verfahren nutzt LSA, um die Dimensionen der Dokument-Begriffs-Matrix zu verringern?
Singulärwertzerlegung (SVD - Singular Value Decomposition)
Warum ist die Dimensionsreduktion bei LSA vorteilhaft für das maschinelle Lernen?
Sie verallgemeinert die Vektordarstellung und entfernt Rauschen sowie unwichtige Variationen.
Was bedeutet die Abkürzung LDA im Kontext der Themenmodellierung?
Latent Dirichlet Allocation
Welche statistische Verteilung bildet die Grundlage für den LDA-Algorithmus?
Die Dirichlet-Verteilung
Von welcher Annahme geht das LDA-Modell bezüglich der Dokumentenzusammensetzung aus?
Dass jedes Dokument eine Mischung aus verschiedenen Themen ist.
Wie wird bei LDA ein Thema definiert?
Als eine Wahrscheinlichkeitsverteilung über einer Sammlung von Wörtern.
Was muss der Anwender beim Start des LDA-Algorithmus vorgeben?
Die Gesamtzahl der zu ermittelnden Themen (K).
Wie ordnet LDA Wörter zu Themen zu?
Durch einen iterativen Prozess,
der die Wahrscheinlichkeiten basierend auf aktuellen Zuordnungen ständig aktualisiert.
Warum ist Lemmatisierung rechenintensiver als Stemming?
Da sie eine morphologische Analyse und oft ein Wörterbuch benötigt, um den Kontext zu verstehen.
Was ist das Hauptproblem bei sehr großen Vokabularen im Bag-of-Words-Modell?
Sie erfordern erhebliche Rechenressourcen aufgrund der hohen Dimensionalität der Vektoren.
Wie können n-Gramme die Leistung von Chatbots verbessern?
Sie helfen der Maschine, den Aufbau und den lokalen Kontext von Sätzen besser zu verstehen.
Was beschreibt die 'Themenbewertung' (topic score) in der LSA?
Eine numerische Gewichtung, wie stark ein Wort oder Dokument mit einem bestimmten latenten Thema verknüpft ist.
Welche Methode kann genutzt werden, um die Ähnlichkeit zwischen zwei Dokumenten im semantischen Raum zu berechnen?
Die Cosinus-Ähnlichkeit (Cosine Similarity).
Was passiert in der ersten Phase des LDA-Algorithmus?
Jedem Wort in jedem Dokument wird zufällig eines der K Themen zugeordnet.
In welchem Anwendungsfall ist die Beibehaltung von Stoppwörtern wie 'nicht' oder 'kein' sinnvoll?
Bei der Sentimentanalyse (Stimmungserkennung), da sie die Bedeutung des Satzes entscheidend verändern.
Welche Information liefert ein hoher IDF-Wert über ein Wort?
Dass das Wort selten ist und somit eine hohe Unterscheidungskraft zwischen Dokumenten besitzt.
Was ist der Zweck der 'Textbereinigung'?
Das Entfernen von Rauschen und irrelevanten Zeichen, um die Qualität der Analyse zu erhöhen.
Welche Rolle spielt die Wahrscheinlichkeit p(Wort w∣Thema t) bei LDA?
Sie gibt an, wie wahrscheinlich es ist, das Wort w zu finden, wenn das Thema t vorliegt.
Wie hilft Themenmodellierung bei der Überprüfung von Lebensläufen?
Sie filtert Bewerber basierend auf den im Text identifizierten Fähigkeiten und Themenbereichen.
Warum werden Texte vor der BoW-Erstellung oft in Kleinbuchstaben umgewandelt?
Damit Wörter wie 'Sound' und 'sound' als identisch erkannt und gezählt werden.
60 von 76
Was versteht man unter 'unüberwachtem Lernen' im Kontext von LSA und LDA?
Die Algorithmen finden Muster (Themen) in den Daten,
ohne dass diese vorher manuell markiert wurden.
Was ist eine 'Dokument-Begriffs-Matrix'?
Eine Tabelle, in der Zeilen Dokumente und Spalten Wörter darstellen, wobei die Zellen die Worthäufigkeiten enthalten.
Welches Problem tritt auf, wenn das Vokabular im BoW-Modell zu klein gewählt wird?
Wichtige unterscheidende Informationen können verloren gehen.
Wie wirkt sich die Dokumentenlänge auf die reine Wortzählung (Term Count) aus?
Längere Dokumente haben tendenziell höhere Wortzählungen, was die Relevanz ohne Normalisierung verfälscht.
Was ist das Ergebnis der Multiplikation von TF und IDF?
Ein Gewichtungsfaktor, der die lokale Wichtigkeit im Dokument gegen die globale Seltenheit im Korpus aufwiegt.
Wie viele Iterationen führt der LDA-Algorithmus typischerweise durch?
Bis eine stabile Themenverteilung erreicht ist oder ein definierter Schwellenwert erreicht wird.
Welche Bedeutung hat ein TF-Wert von 0,5?
Das gesuchte Wort macht die Hälfte aller Wörter in dem spezifischen Dokument aus.
Warum ist die semantische Suche der einfachen Stichwortsuche überlegen?
Sie findet Dokumente basierend auf dem Thema, auch wenn das exakte Suchwort nicht vorkommt.
Was passiert mit Satzzeichen in einer Standard-NLP-Pipeline?
Sie werden meist entfernt, da sie für viele statistische Modelle keinen Informationswert bieten.
Zuletzt geändertvor 5 Tagen