Was ist das Ziel des Gradientenabstiegs?
Die Parameter w des neuronalen Netzes sollen so gefunden werden dass der Fehler J(w) über alle Trainingsbeispiele minimiert wird.
Was ist der Gradient?
Der Gradient beschreibt die Richtung des stärksten Anstiegs einer Funktion.
In welche Richtung werden die Gewichte beim Gradientenabstieg angepasst?
Die Gewichte werden entgegen der Richtung des Gradienten angepasst.
Was wird beim Gradientenabstieg minimiert?
Die Zielfunktion J(w) beziehungsweise der Fehler über alle Trainingsbeispiele.
Was ist Stochastic Gradient Descent (SGD)?
Bei SGD wird die Gewichtsaktualisierung nach jedem einzelnen Trainingsbeispiel durchgeführt.
Wie viele Updates macht SGD pro Epoche?
Bei n Trainingsbeispielen macht SGD genau n Updates pro Epoche.
Was passiert bei SGD mit den Trainingsdaten?
Die Trainingsdaten werden zufällig gemischt und anschließend einzeln verarbeitet.
Was ist Batch Gradient Descent?
Beim Batch Gradient Descent wird der Gradient über alle Trainingsbeispiele gemittelt und anschließend werden die Gewichte einmal aktualisiert.
Wie viele Updates macht Batch Gradient Descent pro Epoche?
Batch Gradient Descent macht genau ein Update pro Epoche.
Was ist Mini-Batch Gradient Descent?
Beim Mini-Batch Gradient Descent wird der Datensatz in kleinere Teilmengen fester Größe B aufgeteilt und für jede Teilmenge ein gemittelter Gradient berechnet.
Wie viele Updates macht Mini-Batch Gradient Descent pro Epoche?
Bei n Trainingsbeispielen und einer Batch-Größe B macht Mini-Batch Gradient Descent n/B Updates pro Epoche.
Was ist der Unterschied zwischen SGD Batch und Mini-Batch Gradient Descent?
SGD verwendet ein Trainingsbeispiel pro Update Batch Gradient Descent verwendet alle Trainingsbeispiele und Mini-Batch Gradient Descent verwendet eine Teilmenge der Trainingsbeispiele.
Was haben SGD Batch und Mini-Batch Gradient Descent gemeinsam?
In einer Epoche wird jedes Trainingsbeispiel genau einmal verarbeitet.
Warum ist das Ergebnis bei Mini-Batch Gradient Descent zufällig?
Weil die Trainingsdaten zufällig gemischt werden und dadurch die Zusammensetzung der Mini-Batches zufällig ist.
Was bezeichnet g beim Batch Gradient Descent?
g ist der gemittelte Gradient über alle Trainingsbeispiele eines Batches.
Was bezeichnet g beim Mini-Batch Gradient Descent?
g ist die Summe der Gradienten innerhalb eines Mini-Batches und wird durch die Batch-Größe B geteilt.
Was ist die Lernrate η?
Die Lernrate η bestimmt wie stark die Gewichte bei einem Gradientenabstiegsschritt verändert werden.
Was passiert wenn ein Gradient für ein Trainingsbeispiel berechnet wurde?
Der Gradient wird verwendet um die Gewichte in Richtung eines kleineren Fehlers anzupassen.
Was bedeutet w* beim Gradientenabstieg?
w* bezeichnet die optimalen Parameter die den Fehler J(w) minimieren sollen.
Welche drei Varianten des Gradientenabstiegs werden in Abschnitt 5 behandelt?
Stochastic Gradient Descent Batch Gradient Descent und Mini-Batch Gradient Descent.
Last changed18 days ago