Daten- und Prozessanalyse im Technikbetrieb – Datensätze nachvollziehbar bereinigen
Daten- und Prozessanalyse im Technikbetrieb – Datensätze nachvollziehbar bereinigen
Zielgruppe: Auszubildende in technischen und IT-Berufen
Niveau: Berufsausbildung – Grundlagen und Anwendung
Lernzeit: 6 Lerneinheiten mit insgesamt etwa 75–90 Minuten
Kurzbeschreibung: Regeln festlegen, fehlerhafte Datensätze erkennen, Veränderungen dokumentieren und Ergebnisse überprüfen.
Lernziel: Du kannst einen technischen Datensatz anhand klarer Regeln bereinigen und jede Veränderung nachvollziehbar begründen.
Sicherheitsregel: Arbeite ausschließlich mit fiktiven Daten in einer lokalen Übungsumgebung. Verwende keine Kunden-, Produktions- oder Zugangsdaten. Führe keine Tests an fremden Netzwerken oder Anlagen durch.
Einleitung
Ein Technikbetrieb nutzt Messdaten, um Fertigungsprozesse zu überwachen. Fehlerhafte oder doppelte Einträge können Auswertungen verfälschen.
Merksatz: Datenbereinigung bedeutet nicht, auffällige Werte passend zu machen. Jede Korrektur braucht eine Regel, einen nachvollziehbaren Grund und eine Dokumentation.

Vom Erfassen über das Bereinigen bis zur Auswertung. Darstellung: Farcaster, CC BY-SA 3.0.
Dein Lernpfad:
| Einheit | Inhalt | Ergebnis |
|---|---|---|
| 1 | Ausbildungsfall verstehen | Fehler finden |
| 2 | Regeln entwickeln | Prüfregeln |
| 3 | Entscheidungen dokumentieren | Änderungsprotokoll |
| 4 | Lokal mit Python bereinigen | Bereinigte CSV-Datei |
| 5 | Daten visualisieren und testen | Diagramm und Testbericht |
| 6 | Ergebnisse übertragen | Begründete Prozessempfehlung |
Lerneinheit 1: Der Ausbildungsfall
Auftrag aus dem Technikbetrieb
Du arbeitest in der fiktiven Ausbildungswerkstatt TechWerk Lernbetrieb.
Eine Messstation namens M7 protokolliert Temperaturen. Die Ausbildungsleitung möchte einen verlässlichen Überblick über den Messverlauf.
Der bereitgestellte Datensatz wurde ausschließlich für diesen Lernkurs erfunden.
Rohdaten untersuchen
| ID | Zeitpunkt | Anlage | Temperatur |
|---|---|---|---|
| 101 | 08:00 | M7 | 21,4 |
| 102 | 08:05 | M7 | 22,1 |
| 102 | 08:05 | M7 | 22,1 |
| 103 | 08:10 | M7 | leer |
| 104 | 08:15 | M7 | 220,0 |
| 105 | 08:20 | M7 | 23,0 |
| 106 | 08:25 | M7 | 21,8 |
| 107 | 08:30 | M7 | N/V |
| 108 | 08:35 | M7 | 23,2 |
Arbeitsauftrag: Markiere die auffälligen Datensätze. Unterscheide zwischen einem Formatproblem, einer Dublette und einem ungeklärten Messwert.
Basisaufgabe: Wie viele Rohzeilen sind vorhanden?
Erwartung: Neun Messzeilen, davon eine exakt doppelt.
Feedback: Gleiche Messwerte sind nicht automatisch Dubletten. Erst der Vergleich der gesamten Zeile und des fachlichen Zusammenhangs erlaubt diese Entscheidung.
Datenqualität verstehen
Datenqualität umfasst unter anderem Vollständigkeit, Konsistenz, Validität, Genauigkeit, Aktualität und Eindeutigkeit.
| Merkmal | Prüffrage | Beispiel |
|---|---|---|
| Vollständigkeit | Fehlt ein benötigter Wert? | ID 103 |
| Eindeutigkeit | Ist eine Zeile mehrfach vorhanden? | ID 102 |
| Validität | Hält der Wert eine festgelegte Regel ein? | ID 104 |
| Konsistenz | Ist die Schreibweise einheitlich? | Dezimalkomma |
| Genauigkeit | Stimmt der Wert mit der Realität überein? | Ohne Referenz nicht sicher prüfbar |
Wichtig: Ein formal gültiger Wert ist nicht automatisch ein tatsächlich richtiger Messwert.
Lerneinheit 2: Bereinigungsregeln

ETL-Prinzip: Daten entnehmen, umformen und für die weitere Verwendung bereitstellen. JakobVoss nach Clemens Kynast, CC0.
Regeln vor der Bearbeitung festlegen
Für diesen Ausbildungsfall gelten folgende Übungsregeln:
| Regel | Entscheidung | Begründung |
|---|---|---|
| R1: Original erhalten | Rohdatei unverändert aufbewahren | Herkunft bleibt nachvollziehbar |
| R2: Identische Rohzeile | Zweite Kopie nicht in die Auswertung übernehmen | Doppelte Zählung vermeiden |
| R3: Dezimalkomma | In Dezimalpunkt umwandeln | Einheitliches Zahlenformat |
| R4: Leerer Wert oder N/V | Als Prüffall kennzeichnen | Kein Messwert darf erfunden werden |
| R5: Temperatur außerhalb 0 bis 80 °C | Als Prüffall kennzeichnen | Übungsregel nicht erfüllt |
| R6: Gleiche ID mit unterschiedlichen Zeilen | Manuell prüfen | Ein ID-Konflikt darf nicht unbemerkt verschwinden |
Achtung: Der Temperaturbereich von 0 bis 80 °C ist ausschließlich eine fiktive Übungsannahme. Er ist keine technische Sicherheitsgrenze für reale Maschinen.
Ausreißer richtig behandeln

Ein Boxplot kann auffällige Verteilungen und mögliche Ausreißer sichtbar machen. RobSeb, CC BY-SA 3.0.
Der Wert 220,0 fällt im Übungsfall außerhalb des vereinbarten Bereichs.
Das beweist nicht, dass in der Realität tatsächlich ein falscher Messwert vorläge. Ebenso wenig darfst Du daraus eigenmächtig 22,0 machen.
Entscheidung: Original erhalten, Prüffall dokumentieren und eine fachliche Klärung vorsehen.
Regel oder Vermutung?
Anwendungsaufgabe: Ein Messwert beträgt 79,9 °C.
Er liegt innerhalb der Übungsregel und ist damit formal gültig. Ob er für eine reale Maschine sicher ist, kann ohne technische Spezifikation nicht entschieden werden.
Feedback: Gute Datenanalyse trennt die Prüfung einer Datenregel von der technischen Bewertung eines Betriebszustands.
Lerneinheit 3: Veränderungen nachvollziehbar dokumentieren
Das Änderungsprotokoll
Dokumentiere, was Du übernommen, normiert, zurückgestellt oder als Dublette behandelt hast.
| ID | Vorher | Nachher | Entscheidung |
|---|---|---|---|
| 101 | 21,4 | 21.4 | Format normiert |
| 102 | Doppelte Zeile | Eine Zeile | Dublette protokolliert |
| 103 | Leer | Unverändert im Original | Prüffall |
| 104 | 220,0 | Unverändert im Original | Prüffall |
| 105 | 23,0 | 23.0 | Format normiert |
| 107 | N/V | Unverändert im Original | Prüffall |
Jeder Eintrag soll mindestens die Datensatz-ID, den ursprünglichen Wert, die Entscheidung, den Grund und gegebenenfalls den neuen Wert enthalten.
Herkunft und Versionen

Visualisierung zum Zusammenhang von Herkunft und Vertrauenswürdigkeit von Daten. Arbeck, CC BY 3.0.
Zur Datenprovenienz gehört die Frage, welche Daten wann und mit welchen Regeln verarbeitet wurden.
Ein Hashwert wie SHA-256 kann helfen, zwei Dateiversionen bytegenau zu vergleichen. Er beweist aber nicht, dass die ursprünglichen Messwerte fachlich korrekt sind.
Merksatz: Eine saubere Auswertung benötigt eine aufbewahrte Quelle, dokumentierte Regeln und überprüfbare Ergebnisse.
Lerneinheit 4: Lokales Python-Datenlabor
Sichere Testumgebung
Du benötigst Python 3.10 oder neuer und einen lokal beschreibbaren Arbeitsordner.
Speichere den folgenden vollständigen Code als kurs.py.
Das Programm verwendet ausschließlich die Python-Standardbibliothek. Es benötigt weder Internet noch fremde Systeme und erstellt für jeden Durchlauf einen neuen lokalen Übungsordner.
Start im Terminal:
python3 kurs.py
Unter Windows funktioniert je nach Installation auch der Aufruf mit py kurs.py.
Ausführbarer Bereinigungsprozess
from pathlib import Path
from tempfile import mkdtemp
from hashlib import sha256
import csv
import json
import unittest
ROH = """id;zeit;anlage;temp_c
101;2026-09-14T08:00;M7;21,4
102;2026-09-14T08:05;M7;22,1
102;2026-09-14T08:05;M7;22,1
103;2026-09-14T08:10;M7;
104;2026-09-14T08:15;M7;220,0
105;2026-09-14T08:20;M7; 23,0
106;2026-09-14T08:25;M7;21,8
107;2026-09-14T08:30;M7;N/V
108;2026-09-14T08:35;M7;23,2
"""
def pruefe(wert):
text = wert.strip().replace(",", ".")
if text in ("", "N/V"):
return None, "Wert fehlt"
try:
zahl = float(text)
except ValueError:
return None, "Kein Zahlenwert"
if not 0 <= zahl <= 80:
return None, "Außerhalb der Übungsregel 0 bis 80 °C"
return f"{zahl:.1f}", "gültig"
def speichere_csv(pfad, spalten, daten):
with pfad.open("w", newline="", encoding="utf-8") as datei:
writer = csv.DictWriter(
datei, fieldnames=spalten, delimiter=";"
)
writer.writeheader()
writer.writerows(daten)
def auswerten():
ordner = Path(mkdtemp(prefix="datenlabor_", dir="."))
quelle = ordner / "roh.csv"
quelle.write_text(ROH, encoding="utf-8")
gut, prueffall, log = [], [], []
zeilen_gesehen, ids_gesehen = set(), set()
with quelle.open(newline="", encoding="utf-8") as datei:
reader = csv.DictReader(datei, delimiter=";")
for nr, zeile in enumerate(reader, 2):
original = zeile["temp_c"]
signatur = tuple(
zeile[k]
for k in ("id", "zeit", "anlage", "temp_c")
)
if signatur in zeilen_gesehen:
aktion, neu, grund = (
"Dublette", "", "Identische Rohzeile"
)
else:
zeilen_gesehen.add(signatur)
if zeile["id"] in ids_gesehen:
aktion, neu, grund = (
"Prüfen", "", "ID-Konflikt"
)
else:
ids_gesehen.add(zeile["id"])
neu, grund = pruefe(original)
if neu is None:
aktion, neu = "Prüfen", ""
else:
aktion = "Übernehmen"
gut.append({
"id": zeile["id"],
"zeit": zeile["zeit"],
"anlage": zeile["anlage"],
"temp_c": neu
})
if neu != original:
grund = "Dezimalkomma/Leerzeichen normiert"
if aktion == "Prüfen":
prueffall.append({
"id": zeile["id"],
"temp_c": original,
"grund": grund
})
log.append({
"zeile": nr,
"id": zeile["id"],
"aktion": aktion,
"vorher": original,
"nachher": neu,
"grund": grund
})
speichere_csv(
ordner / "bereinigt.csv",
["id", "zeit", "anlage", "temp_c"], gut
)
speichere_csv(
ordner / "prueffaelle.csv",
["id", "temp_c", "grund"], prueffall
)
speichere_csv(
ordner / "aenderungslog.csv",
["zeile", "id", "aktion", "vorher",
"nachher", "grund"], log
)
anzahl_dubletten = sum(
eintrag["aktion"] == "Dublette" for eintrag in log
)
bericht = {
"quelle_sha256": sha256(
quelle.read_bytes()
).hexdigest(),
"regelversion": "1.0",
"temp_c_regel": "0 bis 80 °C; Übungsannahme",
"roh": len(log),
"bereinigt": len(gut),
"prueffaelle": len(prueffall),
"dubletten": anzahl_dubletten
}
(ordner / "bericht.json").write_text(
json.dumps(
bericht, ensure_ascii=False, indent=2
),
encoding="utf-8"
)
assert len(log) == (
len(gut) + len(prueffall) + anzahl_dubletten
)
print("Ordner:", ordner.resolve())
print("Roh:", len(log))
print("Bereinigt:", len(gut))
print("Prüffälle:", len(prueffall))
print("Dubletten:", anzahl_dubletten)
print("Temperaturen in °C:")
print("Je █ etwa 0,2 °C über 20 °C")
for zeile in gut:
wert = float(zeile["temp_c"])
balken = "█" * max(
0, round((wert - 20) / 0.2)
)
print(
zeile["id"], balken, f"{wert:.1f}"
)
class TestRegeln(unittest.TestCase):
def test_dezimalkomma(self):
self.assertEqual(
pruefe("21,4"), ("21.4", "gültig")
)
def test_fehlt(self):
self.assertIsNone(pruefe("N/V")[0])
def test_ausreisser(self):
self.assertIsNone(pruefe("220,0")[0])
def test_grenzwert(self):
self.assertEqual(
pruefe("80"), ("80.0", "gültig")
)
if __name__ == "__main__":
auswerten()
Ergebnisdateien
Das Programm legt in einem neuen lokalen Verzeichnis folgende Dateien an:
| Datei | Funktion |
|---|---|
| roh.csv | Ursprünglicher, fiktiver Datensatz |
| bereinigt.csv | Fünf gültige und normierte Zeilen |
| prueffaelle.csv | Drei ungeklärte Datensätze |
| aenderungslog.csv | Entscheidungen zu allen neun Rohzeilen |
| bericht.json | Regelversion, Anzahl der Fälle und SHA-256-Fingerabdruck |
Erwartetes Ergebnis:
Roh: 9 Bereinigt: 5 Prüffälle: 3 Dubletten: 1
Feedback: Der ursprüngliche Datensatz bleibt im Übungsordner erhalten. Nicht verwendete Messwerte verschwinden nicht spurlos, sondern bleiben als Prüffälle beziehungsweise protokollierte Dubletten nachvollziehbar.
Technische Grenze des Beispiels: Das Programm demonstriert ausgewählte Prüfregeln. Für reale Datenflüsse wären zusätzliche Kontrollen etwa für Zeitstempel, Anlagenkennung, Datentypen, Dateischemata und Prozessfreigaben erforderlich.
Lerneinheit 5: Visualisieren und testen
Ergebnisübersicht
Fiktiver Datensatz nach der Regelprüfung:
Rohzeilen █████████ 9 Bereinigt █████ 5 Prüffälle ███ 3 Dubletten █ 1
Die drei unteren Kategorien bilden zusammen die neun Rohzeilen ab.
Beispielhafte Darstellung der verwendbaren Temperaturen:
ID Temperatur Balken 101 21.4 ███████ 102 22.1 ███████████ 105 23.0 ███████████████ 106 21.8 █████████ 108 23.2 ████████████████
Die Balken beginnen bei 20 °C. Ein Block entspricht ungefähr 0,2 °C. Die abgeschnittene Skala macht kleine Unterschiede sichtbarer und muss bei der Interpretation berücksichtigt werden.

Ein weiteres Beispiel für die grafische Darstellung einer Verteilung. StefanPohl, CC0. Nicht die Messwerte des Ausbildungsfalls.
Prozessdaten richtig interpretieren

Beispiel einer statistischen Regelkarte. DanielPenfield, gemeinfrei.
Eine Qualitätsregelkarte kann zeitliche Veränderungen eines Prozesses sichtbar machen.
Beachte: Die dargestellte Regelkarte stammt nicht aus unserer Übungsanlage. Ihre statistischen Grenzen dürfen nicht mit der fiktiven 0-bis-80-°C-Regel verwechselt werden.
Transferfrage: Warum kann eine plötzlich steigende Temperatur eine Untersuchung erfordern, obwohl jeder einzelne Wert die vereinbarte Datengrenze erfüllt?
Feedback: Ein gültiger Einzelwert sagt noch wenig über eine Veränderung des gesamten Prozesses aus.
Lokale interaktive Testumgebung
Die vier automatischen Tests sind bereits in kurs.py enthalten. Sie laufen lokal mit fiktiven Werten.
Start:
python3 -m unittest -v kurs
Erwartung: Vier erfolgreiche Tests mit dem Abschluss OK.
| Test | Erwartung | Begründung |
|---|---|---|
| Dezimalkomma | 21,4 wird 21.4 | Einheitliches Format |
| Fehlender Wert | N/V wird nicht übernommen | Keine erfundenen Werte |
| Ausreißer | 220,0 wird zurückgestellt | Übungsgrenze überschritten |
| Grenzwert | 80 wird akzeptiert | Obere Grenze ist eingeschlossen |
Interaktives Experiment: Ändere in Deiner lokalen Kopie die obere Grenze von 80 auf 79. Führe die Tests erneut aus.
Begründetes Feedback: Der Grenzwerttest soll jetzt fehlschlagen. Das ist hilfreich, weil der Test sichtbar macht, dass sich das Verhalten der Prüfregel verändert hat. Wenn eine neue Grenze fachlich beschlossen wird, müssen Test und Regelversion bewusst angepasst werden.
Wichtig: Ein erfolgreicher Testlauf prüft nur die implementierten Testfälle. Er beweist keine vollständige Fehlerfreiheit.
Gestufte Hilfen
| Hilfestufe | Unterstützung |
|---|---|
| Hilfe 1 – Denkanstoß | Prüfe zunächst, welcher Teil des Datensatzes unverändert bleiben muss. |
| Hilfe 2 – Teilhilfe | Die Funktion pruefe() gibt entweder einen normierten Wert oder einen Prüfgrund zurück.
|
| Hilfe 3 – Lösungshinweis | Wenn Du pruefe("220,0") aufrufst, muss der erste Rückgabewert None sein. Der originale Wert bleibt im Rohdatensatz erhalten.
|
Video: Grundlagen der Datenqualität
IBM Technology: Data Quality Explained. Englischsprachige Ergänzung.
Beobachtungsfrage: Welche Qualitätsdimensionen werden erklärt und welche davon kannst Du direkt im Ausbildungsfall prüfen?
Video: Datenbereinigung mit Python
Alex The Analyst: Data Cleaning in Pandas. Englischsprachige Vertiefung mit der zusätzlichen Bibliothek pandas.
Vergleichsaufgabe: Vergleiche die gezeigten Bereinigungsschritte mit dem lokalen Python-Beispiel. Welche Entscheidungen verlangen weiterhin eine fachliche Begründung?
Hinweis zu externen Medien: YouTube-Videos und eingebettete externe Lernangebote können beim Aufrufen Nutzungsdaten an deren Anbieter übertragen. Sie sind optional und gehören nicht zur lokalen Python-Testumgebung. Übertrage niemals Übungsdateien oder echte Betriebsdaten an diese Dienste.
Lerneinheit 6: Transfer in den Technikbetrieb
Vom Datenfehler zur Prozessverbesserung
Ein Datenfehler kann unterschiedliche Ursachen haben.
| Beobachtung | Mögliche Ursache | Sichere Folgemaßnahme |
|---|---|---|
| Fehlender Wert | Erfassung ausgefallen | Fiktiven Erfassungsprozess untersuchen |
| Doppelte Zeile | Wiederholter Import | Importregel prüfen |
| Uneinheitliches Format | Unterschiedliche Eingabeformate | Einheitliches Format vereinbaren |
| Auffälliger Zahlenwert | Mess-, Übertragungs- oder Eingabeproblem | Quelle und Regel fachlich prüfen |
Wichtig: Eine mögliche Ursache ist noch kein nachgewiesener Fehlergrund.
Mini-Auftrag: Verbesserungsbericht
Erstelle einen kurzen Bericht mit folgenden Inhalten:
- Befund: Welche Qualitätsprobleme wurden erkannt?
- Regeln: Nach welchen Kriterien wurde entschieden?
- Nachvollziehbarkeit: Wie sind Quelle und Veränderungen dokumentiert?
- Verbesserung: Welche Maßnahme könnte das erneute Auftreten eines Fehlers verhindern?
Begründetes Feedback: Ein guter Bericht trennt Beobachtungen, Prüfentscheidungen und vermutete Ursachen. So entsteht aus der Bereinigung eine überprüfbare Empfehlung.
Interaktive Aufgaben
Quiz: Teste Dein Wissen
Warum muss die Rohdatei erhalten bleiben? (Damit die ursprünglichen Daten überprüfbar bleiben) (!Damit alle fehlenden Werte automatisch ersetzt werden) (!Damit keine Prüfregeln benötigt werden) (!Damit Ausreißer grundsätzlich gelöscht werden)
Wann liegt im Ausbildungsbeispiel eine exakte Dublette vor? (Wenn alle verglichenen Felder einer Rohzeile identisch sind) (!Wenn zwei unterschiedliche Messungen dieselbe Temperatur haben) (!Wenn ein Messwert besonders niedrig ist) (!Wenn zwei Anlagen zur selben Uhrzeit messen)
Wie wird der Wert 21,4 für die numerische Ausgabe normiert? (21.4) (!214) (!2.14) (!21.04)
Wie wird der fehlende Temperaturwert in Zeile 103 behandelt? (Er wird als Prüffall dokumentiert) (!Er wird automatisch durch den nächsten Messwert ersetzt) (!Er wird ohne Protokoll gelöscht) (!Er erhält grundsätzlich den Wert Null)
Was geschieht im Übungsfall mit dem Wert 220,0? (Er bleibt als ungeklärter Prüffall nachvollziehbar) (!Er wird immer automatisch auf 22,0 geändert) (!Er wird als gültiger Wert in die Ausgabe übernommen) (!Er wird ohne Dokumentation überschrieben)
Welche Aussage über einen SHA-256-Hashwert ist richtig? (Er kann zur Erkennung von Veränderungen an Dateiinhalten dienen) (!Er garantiert die fachliche Richtigkeit einer Messung) (!Er ersetzt sämtliche Prüfregeln) (!Er ergänzt automatisch fehlende Messwerte)
Wie viele Rohzeilen enthält der fiktive Ausbildungsdatensatz? (Neun) (!Fünf) (!Drei) (!Acht)
Welche Entscheidung ist bei derselben ID mit unterschiedlichen Messzeilen angemessen? (Den Konflikt kennzeichnen und fachlich prüfen) (!Eine Zeile ohne Prüfung auswählen) (!Beide Werte automatisch addieren) (!Den größeren Wert immer löschen)
Was zeigt ein erfolgreicher automatisierter Regeltest? (Der geprüfte Testfall erfüllt die formulierte Erwartung) (!Das gesamte Programm ist garantiert fehlerfrei) (!Die reale Maschine arbeitet sicher) (!Alle Messwerte stimmen mit der Wirklichkeit überein)
Warum werden Bereinigungsregeln versioniert? (Damit spätere Änderungen und Ergebnisse vergleichbar bleiben) (!Damit alle alten Protokolle gelöscht werden können) (!Damit Messwerte nachträglich beliebig angepasst werden können) (!Damit keine Qualitätskontrolle mehr erforderlich ist)
Memory
Ordne jedem Begriff die passende Beschreibung zu.
| Rohdatei | Unveränderte Ausgangsdaten |
| Dublette | Identisch mehrfach vorhandene Rohzeile |
| Prüffall | Datensatz mit ungeklärtem Qualitätsproblem |
| Änderungslog | Dokumentation von Bearbeitungsentscheidungen |
| Hashwert | Fingerabdruck eines Dateiinhalts |
| Validierung | Prüfung anhand festgelegter Regeln |
| Normierung | Vereinheitlichung eines Datenformats |
Drag and Drop
Ordne die Verarbeitungsschritte ihren Aufgaben zu.
| Ordne die richtigen Begriffe zu. | Aufgabe |
|---|---|
| Original sichern | Unbearbeiteten Ausgangszustand erhalten |
| Dublettenprüfung | Identische Rohzeilen erkennen |
| Formatnormierung | Dezimalschreibweisen vereinheitlichen |
| Quarantäne | Ungeklärte Datensätze getrennt aufbewahren |
| Änderungsprotokoll | Jede Entscheidung begründet dokumentieren |
| Regeltest | Erwartetes Programmverhalten überprüfen |
Kreuzworträtsel
| Rohdatei | Wie heißt eine unveränderte Datei mit den ursprünglichen Messwerten? |
| Dublette | Wie nennt man einen identisch mehrfach vorhandenen Datensatz? |
| Hashwert | Wie heißt das Ergebnis einer Hashfunktion? |
| Normierung | Wie heißt die Vereinheitlichung von Datenformaten? |
| Grenzwert | Wie heißt eine festgelegte obere oder untere Schwelle? |
| Prueffall | Wie bezeichnet man einen Datensatz, der noch geklärt werden muss? |
LearningApps
Optionale externe Übungsangebote. Verwende dort keine realen Betriebsdaten.
Lückentext
Rückmeldungen zu den Aufgaben
| Niveau | Richtiges Vorgehen | Begründetes Feedback |
|---|---|---|
| Basis | Fehler erkennen und einordnen | Nur erkannte Datenprobleme können gezielt bearbeitet werden. |
| Anwendung | Prüfregeln ausführen und protokollieren | Eine nachvollziehbare Entscheidung ist überprüfbarer als eine unkommentierte Änderung. |
| Transfer | Ursachen untersuchen und Regeln verbessern | Nachhaltige Datenqualität entsteht durch die Verbesserung des Erfassungsprozesses. |
Offene Aufgaben
Leicht – Basisaufgaben
- Fehlerkarte erstellen: Markiere im fiktiven Datensatz die fehlenden Werte, Dubletten und Formatprobleme. Feedback: Die Trennung unterschiedlicher Fehlerarten verhindert falsche Bereinigungsmaßnahmen.
- Messwerttabelle gestalten: Übertrage die neun Rohzeilen in eine lokale Tabelle und kennzeichne die auffälligen Einträge farblich. Feedback: Eine visuelle Prüfung macht Unregelmäßigkeiten leichter erkennbar.
- Regelplakat entwickeln: Gestalte ein Schaubild mit den sechs Übungsregeln. Feedback: Verständliche Regeln erleichtern die Wiederholung und Kontrolle einer Bereinigung.
- Entscheidungen begründen: Schreibe für drei ausgewählte Zeilen eine kurze Entscheidung mit Begründung. Feedback: Die Begründung macht den Unterschied zwischen einer Vermutung und einer geregelten Bearbeitung sichtbar.
Standard – Anwendungsaufgaben
- Lokales Datenlabor ausführen: Starte das Python-Programm und überprüfe die erzeugten Dateien. Feedback: Ein reproduzierbarer Ablauf sollte zu den dokumentierten Ergebnissen führen.
- Eigene Testfälle entwickeln: Ergänze lokal Tests für einen negativen Wert, einen leeren String und eine ungültige Texteingabe. Feedback: Zusätzliche Grenz- und Fehlerfälle verbessern die Aussagekraft der Tests.
- Messdiagramm gestalten: Erstelle aus den fünf gültigen Übungswerten ein eigenes Diagramm und beschrifte Achsen sowie Einheiten. Feedback: Eine nachvollziehbare Skalierung verhindert irreführende Darstellungen.
- Prüfbericht vergleichen: Vergleiche die Dateien roh.csv, bereinigt.csv und aenderungslog.csv. Erkläre jede Abweichung. Feedback: Jede nachvollziehbare Abweichung stärkt die Prüfbarkeit des Ergebnisses.
Schwer – Transferaufgaben
- ID-Konflikt simulieren: Erzeuge in einer lokalen Kopie eine zweite Zeile mit derselben ID und einem anderen fiktiven Messwert. Prüfe die Reaktion des Programms. Feedback: Ein ID-Konflikt darf nicht mit einer exakten Dublette verwechselt werden.
- Regelversion ändern: Entwickle eine neue fachlich begründete Übungsregel, passe lokal die Tests an und dokumentiere die Änderung. Feedback: Nachvollziehbare Versionen ermöglichen den Vergleich unterschiedlicher Auswertungsergebnisse.
- Fehlerursachen untersuchen: Entwirf ein Ursachen-Wirkungs-Diagramm für doppelt erfasste Messdaten. Feedback: Die Untersuchung möglicher Ursachen ist die Grundlage für vorbeugende Maßnahmen.
- Prüfverfahren bewerten: Entwickle eine Checkliste für eine zweite Person, die die Bereinigung unabhängig kontrolliert. Feedback: Ein gutes Prüfverfahren macht Ergebnisse ohne verborgenes Vorwissen nachvollziehbar.


Lernkontrolle
Bearbeite die folgenden Aufgaben ausschließlich mit den fiktiven Daten und Deiner lokalen Testumgebung.
- Qualitätsentscheidung begründen: Erkläre, warum ein fehlender Messwert nicht automatisch durch den Durchschnitt ersetzt werden sollte.
- Einzelwert und Verlauf vergleichen: Zwei zulässige Messwerte liegen weit auseinander. Begründe, weshalb die bloße Gültigkeit beider Werte nicht ausreicht, um den Prozess als unauffällig zu bewerten.
- Vorbeugende Maßnahme planen: Entwickle für wiederkehrende Dubletten eine Maßnahme im Erfassungsprozess und erkläre, wie Du ihre Wirksamkeit testen würdest.
- Teststrategie überprüfen: Erkläre, warum vier erfolgreiche Unit-Tests keine vollständige Qualitätssicherung darstellen. Nenne sinnvolle zusätzliche Tests.
- Nachvollziehbarkeit bewerten: Eine Kollegin erhält nur die Datei bereinigt.csv. Welche Informationen fehlen ihr, um Deine Entscheidungen unabhängig nachzuvollziehen?
- Sichere Datenverarbeitung beurteilen: Ein Betrieb möchte die echten Messdaten ungefragt an einen öffentlichen Online-Dienst hochladen. Entwickle einen datensparsamen, autorisierten und nachvollziehbaren Alternativablauf.
Bewertungskriterium: Eine überzeugende Antwort stellt Zusammenhänge her, berücksichtigt Grenzen der Daten und begründet ihre Entscheidungen anhand der vereinbarten Regeln.
Lernnachweis
Für einen vollständigen Lernnachweis reichst Du ein lokal erstelltes Ausbildungsportfolio ein.
| Bestandteil | Nachweis |
|---|---|
| Fehleranalyse | Auffälligkeiten des fiktiven Rohdatensatzes sind richtig erkannt. |
| Regelwerk | Prüfregeln sind eindeutig und nachvollziehbar formuliert. |
| Bereinigung | Ursprungsdatei und Ergebnisdatei sind unterscheidbar. |
| Dokumentation | Entscheidungen und Gründe sind im Änderungsprotokoll festgehalten. |
| Testbericht | Die vier Ausgangstests und mindestens zwei eigene Tests sind beschrieben. |
| Visualisierung | Eine korrekt beschriftete Darstellung der gültigen Übungsdaten liegt vor. |
| Reflexion | Grenzen der Bereinigung und mögliche Prozessverbesserungen sind begründet. |
| Sicherheit | Es wurden ausschließlich lokale und fiktive Daten verwendet. |
Empfohlene Gewichtung:
| Bereich | Anteil |
|---|---|
| Fehleranalyse und Regeln | 25 % |
| Technische Umsetzung und Tests | 25 % |
| Dokumentation und Nachvollziehbarkeit | 30 % |
| Transfer und Reflexion | 20 % |
Bestehensmaßstab: Nicht die Anzahl veränderter Werte ist entscheidend, sondern die korrekte, dokumentierte und begründete Behandlung der Datensätze.
OERs zum Thema
Wikipedia: Datenbereinigung
Ergänzende Lernbegriffe: Datenanalyse, Datenqualität, Prozessanalyse, Qualitätsmanagement, Datenvisualisierung, Python und Datenprovenienz.
Fachlich geprüfte Quellen
Die fachlichen Grundlagen wurden anhand folgender öffentlich zugänglicher Dokumentationen geprüft:
- Government Data Quality Framework: Datenqualitätsdimensionen, Qualitätsprüfungen und Datenmanagement.
- Government Data Quality Framework Guidance: Dokumentation von Qualitätsproblemen und Bereinigungsentscheidungen.
- IBM – Dimensionen der Datenqualität: Vollständigkeit, Genauigkeit, Konsistenz, Aktualität, Gültigkeit und Einzigartigkeit.
- W3C PROV-Overview: Nachvollziehbarkeit der Entstehung und Veränderung von Daten.
- Python-Dokumentation – csv: Verarbeitung von CSV-Dateien.
- Python-Dokumentation – hashlib: Hashfunktionen zur Berechnung von Dateifingerabdrücken.
- Python-Dokumentation – unittest: Automatisierte Softwaretests.
Abgrenzung: Die Messstation M7, alle Rohdaten, der Prüfbereich und die Fallentscheidung sind ausdrücklich didaktisch erfunden. Sie stammen nicht aus diesen Quellen und sind keine technischen Betriebsfreigaben.
Mediennachweise und Nutzungsrechte
Die folgenden Bilddateien wurden anhand ihrer Wikimedia-Commons-Dateibeschreibungen und Lizenzangaben ausgewählt.
| Medium | Urheberangabe | Lizenz |
|---|---|---|
| Datenvisualisierungsprozess | Farcaster | CC BY-SA 3.0 |
| ETL-Prozess | JakobVoss nach Clemens Kynast | CC0 |
| Boxplot-Elemente | RobSeb | CC BY-SA 3.0 |
| Provenienz und Vertrauen | Arbeck | CC BY 3.0 |
| Beispiel-Boxplot | StefanPohl | CC0 |
| Regelkarte | DanielPenfield | Gemeinfrei |
Die Bilder werden hier unverändert eingebunden. Bei Weiterverwendung gelten die jeweiligen Lizenzbedingungen, insbesondere Namensnennung und gegebenenfalls Weitergabe unter gleichen Bedingungen.
Videos: Die ausgewählten YouTube-Angebote sind über die offiziellen Videoadressen eingebunden. Eine Einbettung bedeutet nicht, dass deren Videoinhalte frei lizenziert sind. Die Rechte verbleiben bei den jeweiligen Rechteinhabern.
Interne Kursgrafiken und Codebeispiele: Die Tabellen, Textdiagramme und der Python-Übungsdatensatz wurden für diesen Kurs erstellt. Sie bilden keine realen Produktionsdaten ab.
Verknüpfte Lernbereiche
Berufsbezogene Anwendung
Die Lerninhalte sind insbesondere mit folgenden Ausbildungsbereichen verknüpft:
- Fachinformatik: Datenverarbeitung, Qualitätssicherung und Tests.
- Mechatronik: Messdatenerfassung und technische Prozessbeobachtung.
- Elektronik: Dokumentation und Plausibilitätsprüfung von Messdaten.
- Industriemechanik: Prozessqualität und technische Dokumentation.
- Industrie 4.0: Datenqualität als Grundlage digitalisierter Produktionsprozesse.
aiMOOC-Projekte
Schulfach+


aiMOOCs


aiMOOC Projekte


NEWSLernweltNOAH fragen