inny_89
Hey #scala
Macie może jakieś dobre tutoriale, dokumentację odnośnie implementacji ZIO ze #spark ?

Na głównym repo ziverge od zio-spark nie mogę dużo znaleźć, a znowu film Pana Leo Benkela bardzo mnie zaciekawił i chciałbym trochę bardziej zgłębić temat:

#apachespark #databricks
1
  • Najlepsze
  • Wszystkie komentarze
inny_89
A, i nie napisałem, ze chodzi o coś więcej / innego niż od Pana Leo xD
1
inny_89
@inny_89: o, ciekawa zajawka. zwykle piszę albo w jednym albo w drugim - ciężko by mi było przekonać team Sparkowy do ZIO. ma to ręce i nogi według ciebie?


@gabonczyk właśnie generalnie u mnie w firmie mocno zrazili się do scali kiedyś jak z projektami startowali i teraz wszystko na pysparku leci

Moim zdaniem to ma jak najbardziej sens. Lepsze wykorzystanie zasobów klastra i większa asynchronicznosc taskow sprawi, że podobne
1
inny_89
Słuchajcie mam zagadkę. Z zakresu troche fanaberii i sci-fi.

Raczej mniej istotne tło problemu:

Tworzę sobie Wheela w #pythonie i do pełnego wykorzystania tej libki, którą zbuduje jest potrzebna inna libka udostępniana jako plik .JAR.
Lokalnie jak sobie z tym pracuje i odpalam kod w ramach mojego develpmentu na sparku to mam zwyczajnie załączony ten JAR w odpowiedniej lokalizacji i wskazuje go podczas budowania SparkSession. Tak jak na uproszczonym przykłądzie poniżej:
0
  • Najlepsze
  • Wszystkie komentarze
ProfesorBigos
@inny_89: A nie możesz dołączyć tego JARa do wheela? Możesz go też po prostu pobierać z internetu przy pierwszym uruchomieniu kodu.
0
Kura_Wasylisa
@inny_89 init scriptem
0
m.....i
m.....i
Instalował ktoś apache spark na Windowsie? Bardzo głupi pomysł? Chciałbym sobie potestować różne BI toole do niego a niestety darmowy databricks nie pozwala się łączyć z zewnątrz.

#spark #apachespark #bigdata
0
  • Najlepsze
  • Wszystkie komentarze
Krever
Próbowałbym na WSLu najpierw, największa szansa że zadziała bez piększych problemów. Jak nie to kolegał developował kiedyś kod sparkowy an widnowsie, ale nie wiem czy cokolwiek odpalał, więc może bangla ale gwarancji nie dam.
0
y.....l
y.....l
@madry_i_mieciutki: Odpal w VM. Nie spotkałem nikogo, kto by to robił na windowsie.
0
p.....a
p.....a
W jaki sposob mozna okreslic, w jaki sposob podzielic watki, by osiagnac najbardziej optymalne rozwiazanie?
Np jak w Apache Sparku podzielic executory by aplikacje smigaly najbardziej i zaosby byly najlepiej wykorzystywane?

#programowanie #python #apachespark #datascience
0
  • Najlepsze
  • Wszystkie komentarze
dog_meat
@przepyszna_frytka: odpowiedź jest oczywiście: to zależy. A zależy od charakteru pracy wykonywanej przez te wątki. Jeśli są to wątki CPU bound, nie ma sensu tworzyć ich więcej, niż masz dostępnych rdzeni
1
wytrzzeszcz
@przepyszna_frytka: nie znam się ale się wypowiem.

Skoro zysk to s+p/n gdzie s to stała cześć sekwencyjna a p to to się dało zrownoleglic na n procesorów.
Najlepiej by było zdaje się podzielić właśnie na n równych paczek. Dzięki czemu nie tracimy tyle czasu na zarządzanie samym zrownoleglic
Ale to taki tam teoretyczne pitu pitu
0
Tomek7
Tomek7
Apache Spark 2.0.0 wydany! A w wydaniu ponad 2500 poprawek od ponad 300 osób.

Zmian bardzo dużo, m.in.:
1. Dodanie Structured Streaming
2. Pełna obsługa SQL2003
3. Kolejny etap projektu Tungsten, m.in. Whole-stage Code Generation
6
kodi1911
scrapowanie przeszlo pomyslnie, 2793 strony głównej z wykopaliskami, komentarzami, odpowiedziami do komentarzy + hashtagi, zawołania, nawet kolor nicka udało się wyciągnąć - łącznie jakieś 3,5gb danych do analizy ( ͡° ͜ʖ ͡°)

teraz pora na oczyszczenie danych i text mining komentarzy na wykopie ( ͡° ͜ʖ ͡°)

#dataisbeautiful #machinelearning #statystyka #python #apachespark #bigdata
41
  • Najlepsze
  • Wszystkie komentarze