Trele_Duperele
Trele_Duperele
#azure #pyspark #scala #dataengineering #programowanie

Czy ktos mi podpowie czemu scala zostala zepchnieta (przynajmniej z tego co czytam i widze w necie) na drugi plan jako jezyk sparka? Przeciez to jego natywny jezyk?

Tu pytanie do osob siedzacych w Azure i robiacych na nim DE:
Czego sie teraz najwiecej uzywa? PySparka? SparkSQL? Jesli tak to dlaczego? W czym piszecie notebooki?
0
  • Najlepsze
  • Wszystkie komentarze
geringxes
geringxes
Wygląda na kolejność alfabetyczną ( ͡° ͜ʖ ͡°)
2
Trele_Duperele
Trele_Duperele
@vorio: Spotykam duzo komentarzy ze Scala w DE jest martwa i kazdy przechodzi na pythona. Ze nie warto jej sie uczyc.
1
heniek_8
jaki polecacie najlepszy tutorial online (tak żeby sobie puszczać na kompie, patrzeć co wyszło i poprawiać) #pyspark , głownie bym chciał te moduły z dataframe/sql a potem ML

#python #programowanie
0
LucaJune
Mam pytanie uzupełniające do mojego wczorajszego pytania o sortowanie.
Dataframy mi się sortują ładnie. Teraz pytanie - czy taki posortowany dataframe mogę zapisać jako posortowany parquet?
Bo zwykłe zapisane posortowanego df niestety nie daje oczekiwanego rezultatu i parquet (a potem external table z tego parqueta) nie są posortowane po tej kolumnie co dataframe.

Pewnie jest opcja, że się nie da, bo tabela to logiczne dane, a nie posortowany zestaw danych?

0
  • Najlepsze
  • Wszystkie komentarze
ch1nczyk
@LucaJune Z tego co wiem to nie da się osiągnąć sortowania w parquet, ze względu na sposób w jaki zapisuje on dane (kolumny). Z reguly sortowanie musi odbyć się jeszcze raz po wczytaniu.

Jeśli twój DF jest dość mały, możesz spróbować zapisania go jako jedna partycja (df.coalesce(1)), wtedy sortowanie powinno być zachowane, ale tracisz obliczenia na wielu klastrach.
4
programistalvlhard
@LucaJune: @ch1nczyk Dokładnie, zapisując na plikach nie masz opcji zapisania "posortowanego", co najwyżej możesz używać takich metod jak clustering eg https://docs.databricks.com/en/delta/clustering.html czy partycjoniwanie.
1
LucaJune
Mam w Synapsie Analytics dataframe złożony z joinów z 10 innych dataframów, nic przesadnie skomplikowanego.
Ale chcę to posortować i .orderBy(col("nazwakolumny").desc()) mi nie działa.

Jako ciekawostka - w jednym notebooku mi to ładnie działa, a w innym nie.

Nie wywala błędu, tylko po prostu nie sortuje.
1
  • Najlepsze
  • Wszystkie komentarze
wezuza123
@LucaJune lepiej zaciągać wszystkie czymś pokroju import pyspark.sql.functions as F, bo możesz mieć kolizję z funkcjami pythonowymi o tej samej nazwie np. sum, min itp.
2
wezuza123
@LucaJune tak.
2
printHelloWorld
printHelloWorld
Cześć,

Czy ktoś z was miał okazję pracować z technologią hadoop w kontekście zadań związanych z tematyką Machine Learning ? jeśli tak to jak wyglądał proces tworzenia modeli, obróbki danych od początku rozpoczęcia ciągu technicznego ?

Jak rozumiem Hadoop to jest jakby to powiedzieć ogromny magazyn na przechowywanie dosłownie różnych danych z różnych systemów dane te mogą być ustrukturyzowane, nieustrukturyzowane itp. wchodzą oni to jak dobrze rozumiem przestrzeni HDFS na surowo, i jak wiemy
0
  • Najlepsze
  • Wszystkie komentarze
WpisujcieMiasta
@printHelloWorld: masz nakładki na hadoopa i niewiele to się różni od korzystania w źródle z csv albo z bazy Oracle. My korzystamy z impali kudu sparka. A ludzie co robią jakieś cuda na kiju z pythona albo R
0
mccloud
mccloud
#pyspark #awsglue #spark

Mam sobie kolumne z danymi:

60
null
0
  • Najlepsze
  • Wszystkie komentarze
PiotrokeJ
Cześć, dostałem mały projekt w pracy w pysparku. Mała transformacja danych i wrzucenie wyników do nowej tabeli. W punktach opiszę co trzeba zrobić:
1. 4 uniony
2. Pobrać tabelę z mappingiem
3. Zrobić joina (te 4 uniony i mapping)
5. Przerobić 2 kolumny na podstawie wartości, i dodać dwie puste kolumny
4. Wykonać prostą agregacje danych -> groupby po 5 kolumnach.
0
  • Najlepsze
  • Wszystkie komentarze
inny_89
Potrzebuję zrobić #hurtowniedanych w #sqlserver ale jako narzędzie do #etl służy mi #spark, a konkretnie #pyspark

Macie może jakieś dobre materiały albo przykładowe kody, żeby podejrzeć jakieś dobre praktyki?

Jak ogarnąć slow changing dimension? Metadane itp.?
1
  • Najlepsze
  • Wszystkie komentarze
konik_polanowy
12
  • Najlepsze
  • Wszystkie komentarze
konik_polanowy
15
  • Najlepsze
  • Wszystkie komentarze
konik_polanowy
11
  • Najlepsze
  • Wszystkie komentarze