Zum Inhalt springen

Daten- und Prozessanalyse im Technikbetrieb – Datensätze nachvollziehbar bereinigen

Aus MOOCsWiki Staging
Version vom 9. Oktober 2026, 21:18 Uhr von Glanz (Diskussion | Beiträge) (aiMOOC über GPT aiMOOC Action erstellt)
(Unterschied) ← Nächstältere Version | Aktuelle Version (Unterschied) | Nächstjüngere Version → (Unterschied)
aiMOOC-Siegel aiMOOC

Daten- und Prozessanalyse im Technikbetrieb – Datensätze nachvollziehbar bereinigen

QR-Code



Daten- und Prozessanalyse im Technikbetrieb – Datensätze nachvollziehbar bereinigen

Zielgruppe: Auszubildende in technischen und IT-Berufen

Niveau: Berufsausbildung – Grundlagen und Anwendung

Lernzeit: 6 Lerneinheiten mit insgesamt etwa 75–90 Minuten

Kurzbeschreibung: Regeln festlegen, fehlerhafte Datensätze erkennen, Veränderungen dokumentieren und Ergebnisse überprüfen.

Lernziel: Du kannst einen technischen Datensatz anhand klarer Regeln bereinigen und jede Veränderung nachvollziehbar begründen.

Sicherheitsregel: Arbeite ausschließlich mit fiktiven Daten in einer lokalen Übungsumgebung. Verwende keine Kunden-, Produktions- oder Zugangsdaten. Führe keine Tests an fremden Netzwerken oder Anlagen durch.


Einleitung

Ein Technikbetrieb nutzt Messdaten, um Fertigungsprozesse zu überwachen. Fehlerhafte oder doppelte Einträge können Auswertungen verfälschen.

Merksatz: Datenbereinigung bedeutet nicht, auffällige Werte passend zu machen. Jede Korrektur braucht eine Regel, einen nachvollziehbaren Grund und eine Dokumentation.

Vom Erfassen über das Bereinigen bis zur Auswertung. Darstellung: Farcaster, CC BY-SA 3.0.

Dein Lernpfad:

Einheit Inhalt Ergebnis
1 Ausbildungsfall verstehen Fehler finden
2 Regeln entwickeln Prüfregeln
3 Entscheidungen dokumentieren Änderungsprotokoll
4 Lokal mit Python bereinigen Bereinigte CSV-Datei
5 Daten visualisieren und testen Diagramm und Testbericht
6 Ergebnisse übertragen Begründete Prozessempfehlung


Lerneinheit 1: Der Ausbildungsfall


Auftrag aus dem Technikbetrieb

Du arbeitest in der fiktiven Ausbildungswerkstatt TechWerk Lernbetrieb.

Eine Messstation namens M7 protokolliert Temperaturen. Die Ausbildungsleitung möchte einen verlässlichen Überblick über den Messverlauf.

Der bereitgestellte Datensatz wurde ausschließlich für diesen Lernkurs erfunden.


Rohdaten untersuchen

ID Zeitpunkt Anlage Temperatur
101 08:00 M7 21,4
102 08:05 M7 22,1
102 08:05 M7 22,1
103 08:10 M7 leer
104 08:15 M7 220,0
105 08:20 M7 23,0
106 08:25 M7 21,8
107 08:30 M7 N/V
108 08:35 M7 23,2

Arbeitsauftrag: Markiere die auffälligen Datensätze. Unterscheide zwischen einem Formatproblem, einer Dublette und einem ungeklärten Messwert.

Basisaufgabe: Wie viele Rohzeilen sind vorhanden?

Erwartung: Neun Messzeilen, davon eine exakt doppelt.

Feedback: Gleiche Messwerte sind nicht automatisch Dubletten. Erst der Vergleich der gesamten Zeile und des fachlichen Zusammenhangs erlaubt diese Entscheidung.


Datenqualität verstehen

Datenqualität umfasst unter anderem Vollständigkeit, Konsistenz, Validität, Genauigkeit, Aktualität und Eindeutigkeit.

Merkmal Prüffrage Beispiel
Vollständigkeit Fehlt ein benötigter Wert? ID 103
Eindeutigkeit Ist eine Zeile mehrfach vorhanden? ID 102
Validität Hält der Wert eine festgelegte Regel ein? ID 104
Konsistenz Ist die Schreibweise einheitlich? Dezimalkomma
Genauigkeit Stimmt der Wert mit der Realität überein? Ohne Referenz nicht sicher prüfbar

Wichtig: Ein formal gültiger Wert ist nicht automatisch ein tatsächlich richtiger Messwert.


Lerneinheit 2: Bereinigungsregeln

ETL-Prinzip: Daten entnehmen, umformen und für die weitere Verwendung bereitstellen. JakobVoss nach Clemens Kynast, CC0.


Regeln vor der Bearbeitung festlegen

Für diesen Ausbildungsfall gelten folgende Übungsregeln:

Regel Entscheidung Begründung
R1: Original erhalten Rohdatei unverändert aufbewahren Herkunft bleibt nachvollziehbar
R2: Identische Rohzeile Zweite Kopie nicht in die Auswertung übernehmen Doppelte Zählung vermeiden
R3: Dezimalkomma In Dezimalpunkt umwandeln Einheitliches Zahlenformat
R4: Leerer Wert oder N/V Als Prüffall kennzeichnen Kein Messwert darf erfunden werden
R5: Temperatur außerhalb 0 bis 80 °C Als Prüffall kennzeichnen Übungsregel nicht erfüllt
R6: Gleiche ID mit unterschiedlichen Zeilen Manuell prüfen Ein ID-Konflikt darf nicht unbemerkt verschwinden

Achtung: Der Temperaturbereich von 0 bis 80 °C ist ausschließlich eine fiktive Übungsannahme. Er ist keine technische Sicherheitsgrenze für reale Maschinen.


Ausreißer richtig behandeln

Ein Boxplot kann auffällige Verteilungen und mögliche Ausreißer sichtbar machen. RobSeb, CC BY-SA 3.0.

Der Wert 220,0 fällt im Übungsfall außerhalb des vereinbarten Bereichs.

Das beweist nicht, dass in der Realität tatsächlich ein falscher Messwert vorläge. Ebenso wenig darfst Du daraus eigenmächtig 22,0 machen.

Entscheidung: Original erhalten, Prüffall dokumentieren und eine fachliche Klärung vorsehen.


Regel oder Vermutung?

Anwendungsaufgabe: Ein Messwert beträgt 79,9 °C.

Er liegt innerhalb der Übungsregel und ist damit formal gültig. Ob er für eine reale Maschine sicher ist, kann ohne technische Spezifikation nicht entschieden werden.

Feedback: Gute Datenanalyse trennt die Prüfung einer Datenregel von der technischen Bewertung eines Betriebszustands.


Lerneinheit 3: Veränderungen nachvollziehbar dokumentieren


Das Änderungsprotokoll

Dokumentiere, was Du übernommen, normiert, zurückgestellt oder als Dublette behandelt hast.

ID Vorher Nachher Entscheidung
101 21,4 21.4 Format normiert
102 Doppelte Zeile Eine Zeile Dublette protokolliert
103 Leer Unverändert im Original Prüffall
104 220,0 Unverändert im Original Prüffall
105 23,0 23.0 Format normiert
107 N/V Unverändert im Original Prüffall

Jeder Eintrag soll mindestens die Datensatz-ID, den ursprünglichen Wert, die Entscheidung, den Grund und gegebenenfalls den neuen Wert enthalten.


Herkunft und Versionen

Visualisierung zum Zusammenhang von Herkunft und Vertrauenswürdigkeit von Daten. Arbeck, CC BY 3.0.

Zur Datenprovenienz gehört die Frage, welche Daten wann und mit welchen Regeln verarbeitet wurden.

Ein Hashwert wie SHA-256 kann helfen, zwei Dateiversionen bytegenau zu vergleichen. Er beweist aber nicht, dass die ursprünglichen Messwerte fachlich korrekt sind.

Merksatz: Eine saubere Auswertung benötigt eine aufbewahrte Quelle, dokumentierte Regeln und überprüfbare Ergebnisse.


Lerneinheit 4: Lokales Python-Datenlabor


Sichere Testumgebung

Du benötigst Python 3.10 oder neuer und einen lokal beschreibbaren Arbeitsordner.

Speichere den folgenden vollständigen Code als kurs.py.

Das Programm verwendet ausschließlich die Python-Standardbibliothek. Es benötigt weder Internet noch fremde Systeme und erstellt für jeden Durchlauf einen neuen lokalen Übungsordner.

Start im Terminal:

python3 kurs.py

Unter Windows funktioniert je nach Installation auch der Aufruf mit py kurs.py.


Ausführbarer Bereinigungsprozess

from pathlib import Path
from tempfile import mkdtemp
from hashlib import sha256
import csv
import json
import unittest

ROH = """id;zeit;anlage;temp_c
101;2026-09-14T08:00;M7;21,4
102;2026-09-14T08:05;M7;22,1
102;2026-09-14T08:05;M7;22,1
103;2026-09-14T08:10;M7;
104;2026-09-14T08:15;M7;220,0
105;2026-09-14T08:20;M7; 23,0
106;2026-09-14T08:25;M7;21,8
107;2026-09-14T08:30;M7;N/V
108;2026-09-14T08:35;M7;23,2
"""

def pruefe(wert):
    text = wert.strip().replace(",", ".")
    if text in ("", "N/V"):
        return None, "Wert fehlt"
    try:
        zahl = float(text)
    except ValueError:
        return None, "Kein Zahlenwert"
    if not 0 <= zahl <= 80:
        return None, "Außerhalb der Übungsregel 0 bis 80 °C"
    return f"{zahl:.1f}", "gültig"

def speichere_csv(pfad, spalten, daten):
    with pfad.open("w", newline="", encoding="utf-8") as datei:
        writer = csv.DictWriter(
            datei, fieldnames=spalten, delimiter=";"
        )
        writer.writeheader()
        writer.writerows(daten)

def auswerten():
    ordner = Path(mkdtemp(prefix="datenlabor_", dir="."))
    quelle = ordner / "roh.csv"
    quelle.write_text(ROH, encoding="utf-8")

    gut, prueffall, log = [], [], []
    zeilen_gesehen, ids_gesehen = set(), set()

    with quelle.open(newline="", encoding="utf-8") as datei:
        reader = csv.DictReader(datei, delimiter=";")
        for nr, zeile in enumerate(reader, 2):
            original = zeile["temp_c"]
            signatur = tuple(
                zeile[k]
                for k in ("id", "zeit", "anlage", "temp_c")
            )

            if signatur in zeilen_gesehen:
                aktion, neu, grund = (
                    "Dublette", "", "Identische Rohzeile"
                )
            else:
                zeilen_gesehen.add(signatur)

                if zeile["id"] in ids_gesehen:
                    aktion, neu, grund = (
                        "Prüfen", "", "ID-Konflikt"
                    )
                else:
                    ids_gesehen.add(zeile["id"])
                    neu, grund = pruefe(original)

                    if neu is None:
                        aktion, neu = "Prüfen", ""
                    else:
                        aktion = "Übernehmen"
                        gut.append({
                            "id": zeile["id"],
                            "zeit": zeile["zeit"],
                            "anlage": zeile["anlage"],
                            "temp_c": neu
                        })
                        if neu != original:
                            grund = "Dezimalkomma/Leerzeichen normiert"

            if aktion == "Prüfen":
                prueffall.append({
                    "id": zeile["id"],
                    "temp_c": original,
                    "grund": grund
                })

            log.append({
                "zeile": nr,
                "id": zeile["id"],
                "aktion": aktion,
                "vorher": original,
                "nachher": neu,
                "grund": grund
            })

    speichere_csv(
        ordner / "bereinigt.csv",
        ["id", "zeit", "anlage", "temp_c"], gut
    )
    speichere_csv(
        ordner / "prueffaelle.csv",
        ["id", "temp_c", "grund"], prueffall
    )
    speichere_csv(
        ordner / "aenderungslog.csv",
        ["zeile", "id", "aktion", "vorher",
         "nachher", "grund"], log
    )

    anzahl_dubletten = sum(
        eintrag["aktion"] == "Dublette" for eintrag in log
    )

    bericht = {
        "quelle_sha256": sha256(
            quelle.read_bytes()
        ).hexdigest(),
        "regelversion": "1.0",
        "temp_c_regel": "0 bis 80 °C; Übungsannahme",
        "roh": len(log),
        "bereinigt": len(gut),
        "prueffaelle": len(prueffall),
        "dubletten": anzahl_dubletten
    }

    (ordner / "bericht.json").write_text(
        json.dumps(
            bericht, ensure_ascii=False, indent=2
        ),
        encoding="utf-8"
    )

    assert len(log) == (
        len(gut) + len(prueffall) + anzahl_dubletten
    )

    print("Ordner:", ordner.resolve())
    print("Roh:", len(log))
    print("Bereinigt:", len(gut))
    print("Prüffälle:", len(prueffall))
    print("Dubletten:", anzahl_dubletten)

    print("Temperaturen in °C:")
    print("Je █ etwa 0,2 °C über 20 °C")

    for zeile in gut:
        wert = float(zeile["temp_c"])
        balken = "█" * max(
            0, round((wert - 20) / 0.2)
        )
        print(
            zeile["id"], balken, f"{wert:.1f}"
        )

class TestRegeln(unittest.TestCase):
    def test_dezimalkomma(self):
        self.assertEqual(
            pruefe("21,4"), ("21.4", "gültig")
        )

    def test_fehlt(self):
        self.assertIsNone(pruefe("N/V")[0])

    def test_ausreisser(self):
        self.assertIsNone(pruefe("220,0")[0])

    def test_grenzwert(self):
        self.assertEqual(
            pruefe("80"), ("80.0", "gültig")
        )

if __name__ == "__main__":
    auswerten()


Ergebnisdateien

Das Programm legt in einem neuen lokalen Verzeichnis folgende Dateien an:

Datei Funktion
roh.csv Ursprünglicher, fiktiver Datensatz
bereinigt.csv Fünf gültige und normierte Zeilen
prueffaelle.csv Drei ungeklärte Datensätze
aenderungslog.csv Entscheidungen zu allen neun Rohzeilen
bericht.json Regelversion, Anzahl der Fälle und SHA-256-Fingerabdruck

Erwartetes Ergebnis:

Roh:        9
Bereinigt:  5
Prüffälle:  3
Dubletten:  1

Feedback: Der ursprüngliche Datensatz bleibt im Übungsordner erhalten. Nicht verwendete Messwerte verschwinden nicht spurlos, sondern bleiben als Prüffälle beziehungsweise protokollierte Dubletten nachvollziehbar.

Technische Grenze des Beispiels: Das Programm demonstriert ausgewählte Prüfregeln. Für reale Datenflüsse wären zusätzliche Kontrollen etwa für Zeitstempel, Anlagenkennung, Datentypen, Dateischemata und Prozessfreigaben erforderlich.


Lerneinheit 5: Visualisieren und testen


Ergebnisübersicht

Fiktiver Datensatz nach der Regelprüfung:

Rohzeilen      █████████  9
Bereinigt      █████      5
Prüffälle      ███        3
Dubletten      █          1

Die drei unteren Kategorien bilden zusammen die neun Rohzeilen ab.

Beispielhafte Darstellung der verwendbaren Temperaturen:

ID    Temperatur    Balken
101      21.4       ███████
102      22.1       ███████████
105      23.0       ███████████████
106      21.8       █████████
108      23.2       ████████████████

Die Balken beginnen bei 20 °C. Ein Block entspricht ungefähr 0,2 °C. Die abgeschnittene Skala macht kleine Unterschiede sichtbarer und muss bei der Interpretation berücksichtigt werden.

Ein weiteres Beispiel für die grafische Darstellung einer Verteilung. StefanPohl, CC0. Nicht die Messwerte des Ausbildungsfalls.


Prozessdaten richtig interpretieren

Beispiel einer statistischen Regelkarte. DanielPenfield, gemeinfrei.

Eine Qualitätsregelkarte kann zeitliche Veränderungen eines Prozesses sichtbar machen.

Beachte: Die dargestellte Regelkarte stammt nicht aus unserer Übungsanlage. Ihre statistischen Grenzen dürfen nicht mit der fiktiven 0-bis-80-°C-Regel verwechselt werden.

Transferfrage: Warum kann eine plötzlich steigende Temperatur eine Untersuchung erfordern, obwohl jeder einzelne Wert die vereinbarte Datengrenze erfüllt?

Feedback: Ein gültiger Einzelwert sagt noch wenig über eine Veränderung des gesamten Prozesses aus.


Lokale interaktive Testumgebung

Die vier automatischen Tests sind bereits in kurs.py enthalten. Sie laufen lokal mit fiktiven Werten.

Start:

python3 -m unittest -v kurs

Erwartung: Vier erfolgreiche Tests mit dem Abschluss OK.

Test Erwartung Begründung
Dezimalkomma 21,4 wird 21.4 Einheitliches Format
Fehlender Wert N/V wird nicht übernommen Keine erfundenen Werte
Ausreißer 220,0 wird zurückgestellt Übungsgrenze überschritten
Grenzwert 80 wird akzeptiert Obere Grenze ist eingeschlossen

Interaktives Experiment: Ändere in Deiner lokalen Kopie die obere Grenze von 80 auf 79. Führe die Tests erneut aus.

Begründetes Feedback: Der Grenzwerttest soll jetzt fehlschlagen. Das ist hilfreich, weil der Test sichtbar macht, dass sich das Verhalten der Prüfregel verändert hat. Wenn eine neue Grenze fachlich beschlossen wird, müssen Test und Regelversion bewusst angepasst werden.

Wichtig: Ein erfolgreicher Testlauf prüft nur die implementierten Testfälle. Er beweist keine vollständige Fehlerfreiheit.


Gestufte Hilfen

Hilfestufe Unterstützung
Hilfe 1 – Denkanstoß Prüfe zunächst, welcher Teil des Datensatzes unverändert bleiben muss.
Hilfe 2 – Teilhilfe Die Funktion pruefe() gibt entweder einen normierten Wert oder einen Prüfgrund zurück.
Hilfe 3 – Lösungshinweis Wenn Du pruefe("220,0") aufrufst, muss der erste Rückgabewert None sein. Der originale Wert bleibt im Rohdatensatz erhalten.


Video: Grundlagen der Datenqualität

IBM Technology: Data Quality Explained. Englischsprachige Ergänzung.

Beobachtungsfrage: Welche Qualitätsdimensionen werden erklärt und welche davon kannst Du direkt im Ausbildungsfall prüfen?


Video: Datenbereinigung mit Python

Alex The Analyst: Data Cleaning in Pandas. Englischsprachige Vertiefung mit der zusätzlichen Bibliothek pandas.

Vergleichsaufgabe: Vergleiche die gezeigten Bereinigungsschritte mit dem lokalen Python-Beispiel. Welche Entscheidungen verlangen weiterhin eine fachliche Begründung?

Hinweis zu externen Medien: YouTube-Videos und eingebettete externe Lernangebote können beim Aufrufen Nutzungsdaten an deren Anbieter übertragen. Sie sind optional und gehören nicht zur lokalen Python-Testumgebung. Übertrage niemals Übungsdateien oder echte Betriebsdaten an diese Dienste.


Lerneinheit 6: Transfer in den Technikbetrieb


Vom Datenfehler zur Prozessverbesserung

Ein Datenfehler kann unterschiedliche Ursachen haben.

Beobachtung Mögliche Ursache Sichere Folgemaßnahme
Fehlender Wert Erfassung ausgefallen Fiktiven Erfassungsprozess untersuchen
Doppelte Zeile Wiederholter Import Importregel prüfen
Uneinheitliches Format Unterschiedliche Eingabeformate Einheitliches Format vereinbaren
Auffälliger Zahlenwert Mess-, Übertragungs- oder Eingabeproblem Quelle und Regel fachlich prüfen

Wichtig: Eine mögliche Ursache ist noch kein nachgewiesener Fehlergrund.


Mini-Auftrag: Verbesserungsbericht

Erstelle einen kurzen Bericht mit folgenden Inhalten:

  1. Befund: Welche Qualitätsprobleme wurden erkannt?
  2. Regeln: Nach welchen Kriterien wurde entschieden?
  3. Nachvollziehbarkeit: Wie sind Quelle und Veränderungen dokumentiert?
  4. Verbesserung: Welche Maßnahme könnte das erneute Auftreten eines Fehlers verhindern?

Begründetes Feedback: Ein guter Bericht trennt Beobachtungen, Prüfentscheidungen und vermutete Ursachen. So entsteht aus der Bereinigung eine überprüfbare Empfehlung.


Interaktive Aufgaben


Quiz: Teste Dein Wissen

Warum muss die Rohdatei erhalten bleiben? (Damit die ursprünglichen Daten überprüfbar bleiben) (!Damit alle fehlenden Werte automatisch ersetzt werden) (!Damit keine Prüfregeln benötigt werden) (!Damit Ausreißer grundsätzlich gelöscht werden)




Wann liegt im Ausbildungsbeispiel eine exakte Dublette vor? (Wenn alle verglichenen Felder einer Rohzeile identisch sind) (!Wenn zwei unterschiedliche Messungen dieselbe Temperatur haben) (!Wenn ein Messwert besonders niedrig ist) (!Wenn zwei Anlagen zur selben Uhrzeit messen)




Wie wird der Wert 21,4 für die numerische Ausgabe normiert? (21.4) (!214) (!2.14) (!21.04)




Wie wird der fehlende Temperaturwert in Zeile 103 behandelt? (Er wird als Prüffall dokumentiert) (!Er wird automatisch durch den nächsten Messwert ersetzt) (!Er wird ohne Protokoll gelöscht) (!Er erhält grundsätzlich den Wert Null)




Was geschieht im Übungsfall mit dem Wert 220,0? (Er bleibt als ungeklärter Prüffall nachvollziehbar) (!Er wird immer automatisch auf 22,0 geändert) (!Er wird als gültiger Wert in die Ausgabe übernommen) (!Er wird ohne Dokumentation überschrieben)




Welche Aussage über einen SHA-256-Hashwert ist richtig? (Er kann zur Erkennung von Veränderungen an Dateiinhalten dienen) (!Er garantiert die fachliche Richtigkeit einer Messung) (!Er ersetzt sämtliche Prüfregeln) (!Er ergänzt automatisch fehlende Messwerte)




Wie viele Rohzeilen enthält der fiktive Ausbildungsdatensatz? (Neun) (!Fünf) (!Drei) (!Acht)




Welche Entscheidung ist bei derselben ID mit unterschiedlichen Messzeilen angemessen? (Den Konflikt kennzeichnen und fachlich prüfen) (!Eine Zeile ohne Prüfung auswählen) (!Beide Werte automatisch addieren) (!Den größeren Wert immer löschen)




Was zeigt ein erfolgreicher automatisierter Regeltest? (Der geprüfte Testfall erfüllt die formulierte Erwartung) (!Das gesamte Programm ist garantiert fehlerfrei) (!Die reale Maschine arbeitet sicher) (!Alle Messwerte stimmen mit der Wirklichkeit überein)




Warum werden Bereinigungsregeln versioniert? (Damit spätere Änderungen und Ergebnisse vergleichbar bleiben) (!Damit alle alten Protokolle gelöscht werden können) (!Damit Messwerte nachträglich beliebig angepasst werden können) (!Damit keine Qualitätskontrolle mehr erforderlich ist)





Memory

Ordne jedem Begriff die passende Beschreibung zu.

Rohdatei Unveränderte Ausgangsdaten
Dublette Identisch mehrfach vorhandene Rohzeile
Prüffall Datensatz mit ungeklärtem Qualitätsproblem
Änderungslog Dokumentation von Bearbeitungsentscheidungen
Hashwert Fingerabdruck eines Dateiinhalts
Validierung Prüfung anhand festgelegter Regeln
Normierung Vereinheitlichung eines Datenformats





Drag and Drop

Ordne die Verarbeitungsschritte ihren Aufgaben zu.

Ordne die richtigen Begriffe zu. Aufgabe
Original sichern Unbearbeiteten Ausgangszustand erhalten
Dublettenprüfung Identische Rohzeilen erkennen
Formatnormierung Dezimalschreibweisen vereinheitlichen
Quarantäne Ungeklärte Datensätze getrennt aufbewahren
Änderungsprotokoll Jede Entscheidung begründet dokumentieren
Regeltest Erwartetes Programmverhalten überprüfen





Kreuzworträtsel

Rohdatei Wie heißt eine unveränderte Datei mit den ursprünglichen Messwerten?
Dublette Wie nennt man einen identisch mehrfach vorhandenen Datensatz?
Hashwert Wie heißt das Ergebnis einer Hashfunktion?
Normierung Wie heißt die Vereinheitlichung von Datenformaten?
Grenzwert Wie heißt eine festgelegte obere oder untere Schwelle?
Prueffall Wie bezeichnet man einen Datensatz, der noch geklärt werden muss?





LearningApps

Optionale externe Übungsangebote. Verwende dort keine realen Betriebsdaten.


Lückentext

Vervollständige den Text.
Vor der Bereinigung bewahrst Du die

unverändert auf.
Die Prüfung auf mehrfach vorhandene identische Rohzeilen heißt

im Datenlabor.
Fehlende Messwerte werden als

dokumentiert.
Einheitliche Schreibweisen entstehen durch

der Daten.
Der Wert 220,0 überschreitet im Beispiel den vereinbarten

deutlich.
Das

dokumentiert die einzelnen Entscheidungen.
Ein

hilft beim Vergleich von Dateiinhalten.
Automatisierte

überprüfen das erwartete Verhalten von Regeln.
Ausgewählte gültige Messwerte stehen in der

für eine spätere Analyse bereit.
Die fiktive Anlage des Ausbildungsfalls trägt die Kennzeichnung

im Messprotokoll.
Die Regeln erhalten eine eindeutige

zur Nachverfolgung von Veränderungen.




Rückmeldungen zu den Aufgaben

Niveau Richtiges Vorgehen Begründetes Feedback
Basis Fehler erkennen und einordnen Nur erkannte Datenprobleme können gezielt bearbeitet werden.
Anwendung Prüfregeln ausführen und protokollieren Eine nachvollziehbare Entscheidung ist überprüfbarer als eine unkommentierte Änderung.
Transfer Ursachen untersuchen und Regeln verbessern Nachhaltige Datenqualität entsteht durch die Verbesserung des Erfassungsprozesses.


Offene Aufgaben


Leicht – Basisaufgaben

  1. Fehlerkarte erstellen: Markiere im fiktiven Datensatz die fehlenden Werte, Dubletten und Formatprobleme. Feedback: Die Trennung unterschiedlicher Fehlerarten verhindert falsche Bereinigungsmaßnahmen.
  2. Messwerttabelle gestalten: Übertrage die neun Rohzeilen in eine lokale Tabelle und kennzeichne die auffälligen Einträge farblich. Feedback: Eine visuelle Prüfung macht Unregelmäßigkeiten leichter erkennbar.
  3. Regelplakat entwickeln: Gestalte ein Schaubild mit den sechs Übungsregeln. Feedback: Verständliche Regeln erleichtern die Wiederholung und Kontrolle einer Bereinigung.
  4. Entscheidungen begründen: Schreibe für drei ausgewählte Zeilen eine kurze Entscheidung mit Begründung. Feedback: Die Begründung macht den Unterschied zwischen einer Vermutung und einer geregelten Bearbeitung sichtbar.


Standard – Anwendungsaufgaben

  1. Lokales Datenlabor ausführen: Starte das Python-Programm und überprüfe die erzeugten Dateien. Feedback: Ein reproduzierbarer Ablauf sollte zu den dokumentierten Ergebnissen führen.
  2. Eigene Testfälle entwickeln: Ergänze lokal Tests für einen negativen Wert, einen leeren String und eine ungültige Texteingabe. Feedback: Zusätzliche Grenz- und Fehlerfälle verbessern die Aussagekraft der Tests.
  3. Messdiagramm gestalten: Erstelle aus den fünf gültigen Übungswerten ein eigenes Diagramm und beschrifte Achsen sowie Einheiten. Feedback: Eine nachvollziehbare Skalierung verhindert irreführende Darstellungen.
  4. Prüfbericht vergleichen: Vergleiche die Dateien roh.csv, bereinigt.csv und aenderungslog.csv. Erkläre jede Abweichung. Feedback: Jede nachvollziehbare Abweichung stärkt die Prüfbarkeit des Ergebnisses.


Schwer – Transferaufgaben

  1. ID-Konflikt simulieren: Erzeuge in einer lokalen Kopie eine zweite Zeile mit derselben ID und einem anderen fiktiven Messwert. Prüfe die Reaktion des Programms. Feedback: Ein ID-Konflikt darf nicht mit einer exakten Dublette verwechselt werden.
  2. Regelversion ändern: Entwickle eine neue fachlich begründete Übungsregel, passe lokal die Tests an und dokumentiere die Änderung. Feedback: Nachvollziehbare Versionen ermöglichen den Vergleich unterschiedlicher Auswertungsergebnisse.
  3. Fehlerursachen untersuchen: Entwirf ein Ursachen-Wirkungs-Diagramm für doppelt erfasste Messdaten. Feedback: Die Untersuchung möglicher Ursachen ist die Grundlage für vorbeugende Maßnahmen.
  4. Prüfverfahren bewerten: Entwickle eine Checkliste für eine zweite Person, die die Bereinigung unabhängig kontrolliert. Feedback: Ein gutes Prüfverfahren macht Ergebnisse ohne verborgenes Vorwissen nachvollziehbar.




Text bearbeiten Bild einfügen Video einbetten Interaktive Aufgaben erstellen



Lernkontrolle

Bearbeite die folgenden Aufgaben ausschließlich mit den fiktiven Daten und Deiner lokalen Testumgebung.

  1. Qualitätsentscheidung begründen: Erkläre, warum ein fehlender Messwert nicht automatisch durch den Durchschnitt ersetzt werden sollte.
  2. Einzelwert und Verlauf vergleichen: Zwei zulässige Messwerte liegen weit auseinander. Begründe, weshalb die bloße Gültigkeit beider Werte nicht ausreicht, um den Prozess als unauffällig zu bewerten.
  3. Vorbeugende Maßnahme planen: Entwickle für wiederkehrende Dubletten eine Maßnahme im Erfassungsprozess und erkläre, wie Du ihre Wirksamkeit testen würdest.
  4. Teststrategie überprüfen: Erkläre, warum vier erfolgreiche Unit-Tests keine vollständige Qualitätssicherung darstellen. Nenne sinnvolle zusätzliche Tests.
  5. Nachvollziehbarkeit bewerten: Eine Kollegin erhält nur die Datei bereinigt.csv. Welche Informationen fehlen ihr, um Deine Entscheidungen unabhängig nachzuvollziehen?
  6. Sichere Datenverarbeitung beurteilen: Ein Betrieb möchte die echten Messdaten ungefragt an einen öffentlichen Online-Dienst hochladen. Entwickle einen datensparsamen, autorisierten und nachvollziehbaren Alternativablauf.

Bewertungskriterium: Eine überzeugende Antwort stellt Zusammenhänge her, berücksichtigt Grenzen der Daten und begründet ihre Entscheidungen anhand der vereinbarten Regeln.




Lernnachweis

Für einen vollständigen Lernnachweis reichst Du ein lokal erstelltes Ausbildungsportfolio ein.

Bestandteil Nachweis
Fehleranalyse Auffälligkeiten des fiktiven Rohdatensatzes sind richtig erkannt.
Regelwerk Prüfregeln sind eindeutig und nachvollziehbar formuliert.
Bereinigung Ursprungsdatei und Ergebnisdatei sind unterscheidbar.
Dokumentation Entscheidungen und Gründe sind im Änderungsprotokoll festgehalten.
Testbericht Die vier Ausgangstests und mindestens zwei eigene Tests sind beschrieben.
Visualisierung Eine korrekt beschriftete Darstellung der gültigen Übungsdaten liegt vor.
Reflexion Grenzen der Bereinigung und mögliche Prozessverbesserungen sind begründet.
Sicherheit Es wurden ausschließlich lokale und fiktive Daten verwendet.

Empfohlene Gewichtung:

Bereich Anteil
Fehleranalyse und Regeln 25 %
Technische Umsetzung und Tests 25 %
Dokumentation und Nachvollziehbarkeit 30 %
Transfer und Reflexion 20 %

Bestehensmaßstab: Nicht die Anzahl veränderter Werte ist entscheidend, sondern die korrekte, dokumentierte und begründete Behandlung der Datensätze.




OERs zum Thema

Wikipedia: Datenbereinigung

Ergänzende Lernbegriffe: Datenanalyse, Datenqualität, Prozessanalyse, Qualitätsmanagement, Datenvisualisierung, Python und Datenprovenienz.


Fachlich geprüfte Quellen

Die fachlichen Grundlagen wurden anhand folgender öffentlich zugänglicher Dokumentationen geprüft:

  1. Government Data Quality Framework: Datenqualitätsdimensionen, Qualitätsprüfungen und Datenmanagement.
  2. Government Data Quality Framework Guidance: Dokumentation von Qualitätsproblemen und Bereinigungsentscheidungen.
  3. IBM – Dimensionen der Datenqualität: Vollständigkeit, Genauigkeit, Konsistenz, Aktualität, Gültigkeit und Einzigartigkeit.
  4. W3C PROV-Overview: Nachvollziehbarkeit der Entstehung und Veränderung von Daten.
  5. Python-Dokumentation – csv: Verarbeitung von CSV-Dateien.
  6. Python-Dokumentation – hashlib: Hashfunktionen zur Berechnung von Dateifingerabdrücken.
  7. Python-Dokumentation – unittest: Automatisierte Softwaretests.

Abgrenzung: Die Messstation M7, alle Rohdaten, der Prüfbereich und die Fallentscheidung sind ausdrücklich didaktisch erfunden. Sie stammen nicht aus diesen Quellen und sind keine technischen Betriebsfreigaben.


Mediennachweise und Nutzungsrechte

Die folgenden Bilddateien wurden anhand ihrer Wikimedia-Commons-Dateibeschreibungen und Lizenzangaben ausgewählt.

Medium Urheberangabe Lizenz
Datenvisualisierungsprozess Farcaster CC BY-SA 3.0
ETL-Prozess JakobVoss nach Clemens Kynast CC0
Boxplot-Elemente RobSeb CC BY-SA 3.0
Provenienz und Vertrauen Arbeck CC BY 3.0
Beispiel-Boxplot StefanPohl CC0
Regelkarte DanielPenfield Gemeinfrei

Die Bilder werden hier unverändert eingebunden. Bei Weiterverwendung gelten die jeweiligen Lizenzbedingungen, insbesondere Namensnennung und gegebenenfalls Weitergabe unter gleichen Bedingungen.

Videos: Die ausgewählten YouTube-Angebote sind über die offiziellen Videoadressen eingebunden. Eine Einbettung bedeutet nicht, dass deren Videoinhalte frei lizenziert sind. Die Rechte verbleiben bei den jeweiligen Rechteinhabern.

Interne Kursgrafiken und Codebeispiele: Die Tabellen, Textdiagramme und der Python-Übungsdatensatz wurden für diesen Kurs erstellt. Sie bilden keine realen Produktionsdaten ab.


Verknüpfte Lernbereiche


Berufsbezogene Anwendung

Die Lerninhalte sind insbesondere mit folgenden Ausbildungsbereichen verknüpft:

  1. Fachinformatik: Datenverarbeitung, Qualitätssicherung und Tests.
  2. Mechatronik: Messdatenerfassung und technische Prozessbeobachtung.
  3. Elektronik: Dokumentation und Plausibilitätsprüfung von Messdaten.
  4. Industriemechanik: Prozessqualität und technische Dokumentation.
  5. Industrie 4.0: Datenqualität als Grundlage digitalisierter Produktionsprozesse.


aiMOOC-Projekte



Schulfach+




aiMOOCs



aiMOOC Projekte









MOOCwiki · Deutsch

Nach dem Lernen ist vor dem Lernen

Entdecke direkt den nächsten Lernkurs. Weitere Inhalte erscheinen, wenn Du weiter nach unten scrollst.

Zur MOOCwiki-Hauptseite

Mediathek

Inhalte werden geladen ...

Mediathek wird aus dem Wiki geladen ...