Unsere Blogbeiträge zum Thema Data Science & AI:

Nutzen von privaten Python Packages in Vertex AI - 3
Nutzen von privaten Python Packages in Vertex AI - 3

Nutzen von privaten Python Packages in Vertex AI - 3

Als Data Scientists trainieren wir regelmäßig unterschiedliche Machine-Learning-Modelle in der Cloud. Wie Du Dein Modelltraining mithilfe von Python Packages nun strukturierst, erfährst Du hier. Denn obwohl jedes Modell seinen eigenen, individuellen Anwendungszweck hat, fällt irgendwann auf, dass Codeschnipsel von einem Projekt in das andere kopiert werden. Bei mir ist es häufig Code für das Einlesen von Daten aus einer Datenbank oder für einen Preprocessing-Schritt. Um genau dieses Kopieren von Code zu vermeiden, sind Python-Pakete ideal geeignet – oft genutzte Funktionen lassen sich an einem Ort sammeln. Dies bringt viele Vorteile bei der Wartung und dem Testing des Codes.Im folgenden Blogartikel wollen wir uns ansehen, wie ein Python-Paket in der GCP nutzbar gemacht und in einen Vertex-AI-Training-Job eingebunden werden kann.

HOWTO: Große Dateien verarbeiten mit Standard-Python
HOWTO: Große Dateien verarbeiten mit Standard-Python

HOWTO: Große Dateien verarbeiten mit Standard-Python

Vorgefertigte Datensätze, die den Rahmen sprengen

Häufig werde ich mit bereitgestellten Rohdaten für Analysen konfrontiert, welche sich unkomprimiert durchaus auf Dateien von einem halben Gigabyte oder mehr erstrecken. Ab einem Gigabyte kommen die Desktop-gestützten Statistik-Tools langsam ins Schwitzen. Es gibt natürlich je nach Tool Möglichkeiten, nur einen Teil der Spalten zu selektieren oder nur die ersten 10.000 Zeilen zu laden usw.

Aber was macht man, wenn man aus der Datenlieferung nur eine zufällige Stichprobe ziehen möchte? Man darf sich nie darauf verlassen, dass die Datei zufällig sortiert ist. Sie kann durch Prozesse im Datenbankexport bereits systematische Reihenfolgeeffekte beinhalten. Es kann aber auch vorkommen, dass man z.B. nur ein Zehntel einer Gruppierung analysieren möchte, wie etwa die Einkäufe jedes zehnten Kunden. Dazu muss die komplette Datei gelesen werden, sonst kann man nie sicherstellen, dass alle Einkäufe der gefilterten Kunden berücksichtigt wurden.

HOWTO: Einfaches Web Scraping mit Python
HOWTO: Einfaches Web Scraping mit Python

HOWTO: Einfaches Web Scraping mit Python

Erschlagendes Angebot im Webshop

Vor zwei Wochen wurde ich von einem oft genutzten Online-Versand, dessen Namen an ein Fluss in Südamerika erinnert, per freundlicher Info-Mail auf eine Aktion aufmerksam gemacht. Und zwar wurden mir drei Musik-CDs aus einer großen Auswahl für 15€ angeboten.

Ich erwerbe immer noch gerne, wie früher, Musik auf physischen Tonträgern und wollte mir das Angebot genauer ansehen. Nun stellte sich heraus, dass etwa 9,000 CDs offeriert wurden, und das über etwa 400 Seiten im Online-Shop. Dieser Shop bietet mir die Möglichkeit, das Angebot nach Beliebtheit oder nach Kundenbewertung zu sortieren. Wenn ich jedoch die Beliebtheit absteigend betrachte, finde ich viele Titel, die nicht mehr ganz meiner Altersklasse entsprechen. Andererseits, wenn ich nach Kundenbewertung sortiere, stellt sich heraus, dass der Shop die Bewertungen ungewichtet verarbeitet. D.h. irgendeine CD mit volkstümlichen Schlagern wird mit nur einer 5-Sterne Bewertung vor einer anderen CD mit 4.9 Sternen auf 1000 Bewertungen aufgeführt.

Hochleistungs(denk)sport mit R
Hochleistungs(denk)sport mit R

Hochleistungs(denk)sport mit R

Dieser Beitrag beschäftigt sich grundsätzlich und in sehr kurzer Form mit folgenden drei Fragen:

  • Woran denkt ein datengetriebener Mensch, wenn er Behauptungen hört?
  • Welches Tool ist für Datenanalysen praktischer: R, Python, Java, MATLAB?
  • Können Sportdisziplinen das nächste Gebiet zur Anwendung der Datenanalysen und des maschinellen Lernens sein?
Fehlende Werte in logistischer Regression
Fehlende Werte in logistischer Regression

Fehlende Werte in logistischer Regression

Die logistische Regression ist neben Entscheidungsbäumen das Arbeitspferd in der Modellierung, um das Eintreten eines Ereignisses vorherzusagen. Nun sind beide Verfahren zum Glück so ausgelegt, dass man im Grunde jede Art von Prädiktor für die Vorhersage einsetzen kann, egal ob dichotome Kategorien, mehrstufige Kategorien oder stetige Variablen auf Intervallskalenniveau.

Ein Blick in die Data-Science-Werkzeugkiste
Ein Blick in die Data-Science-Werkzeugkiste

Ein Blick in die Data-Science-Werkzeugkiste

In diesem Eintrag möchte ich gemeinsam mit Ihnen einen Blick in unsere Werkzeugkiste werfen. Das Thema bietet Stoff für mehr als einen Eintrag, und wir werden in diesem Blog immer mal wieder darauf zurückkommen.

Das Monty-Hall-Dilemma/Ziegenproblem in 10 Python-Zeilen
Das Monty-Hall-Dilemma/Ziegenproblem in 10 Python-Zeilen

Das Monty-Hall-Dilemma/Ziegenproblem in 10 Python-Zeilen

Hintergrund zum Dilemma

So manch einer erinnert sich an die Spielshow "Geh aufs Ganze" aus den 90ern, in der Kandidaten sich für eines von drei Toren entscheiden mussten. Hinter einem Tor war stets der Preis versteckt und hinter den anderen Toren waren Nieten in Form des Zonk, bzw. in den USA bei Moderator Monty Hall waren es Ziegen. Der Kandidat wählt zu Beginn immer ein Tor aus, hinter dem er den Preis vermutet. Der Moderator kann anschließend versuchen, ihn auf andere Tore mit Geldangeboten umzustimmen. Er kann auch Tore öffnen, um die Spannung zu erhöhen.

Recommendation Systems - Teil 1: Motivation & Grundlage
Recommendation Systems - Teil 1: Motivation & Grundlage

Recommendation Systems - Teil 1: Motivation & Grundlage

Dieser Blogbeitrag beantwortet zwei Fragebereiche:

  1. Für wen ist ein Recommendation System relevant? Warum?
  2. Welche grundsätzlichen Varianten gibt es? Wie aufwändig ist eine dementsprechende Implementierung?
R Tipps und Tricks - Teil 1
R Tipps und Tricks - Teil 1

R Tipps und Tricks - Teil 1

R, der Open-Source-Allrounder mit schwerem Einstieg

Vor etwa drei Jahren bin ich von kommerziellen Statistiklösungen, wie SPSS, auf R umgestiegen. Mittlerweile kann ich mit Überzeugung sagen, dass ich erstmal kein anderes Tool mehr für Advanced Analytics brauche. Vor allem in Verbindung mit der IDE "R-Studio" hat die Software einen Reifegrad erreicht, um sie bedenkenlos in großen Data-Science-Projekten einzusetzen.

Man braucht sich allerdings nicht vormachen, dass man R einfach installiert und loslegt. Die Lernkurve ist vergleichsweise steil und es gibt nicht nur in Bezug auf die verschiedenen Pakete viele unterschiedliche Wege, dasselbe zu tun. Nicht selten hab ich mich geärgert, dass ich mitten im Auswerten plötzlich über einen banalen Schritt gestolpert bin, dessen Umsetzung ich für R erst recherchieren musste. Ich möchte daher in diesem und hoffentlich vielen folgenden Teilen Tipps und Tricks für R aufgreifen, die ich gerne schon früher als Einsteiger gekannt hätte.