Przy takich statystykach warto zawsze jednak zwrócić uwagę na taką rzecz jak specyfika nazwijmy to mieszkalnictwa w określonym kraju, która jest jakoś zdeterminowana przez obyczaj. No bo np, na polskiej wsi, na starych osiedlach podmiejskich, w mniejszych miastach na ogół składających się z domów jednorodzinnych i to przeważnie dużych zawsze będzie ktoś kto zostaje i dziedziczy dom, a czasami jest nawet tak że dzieli się go na pół między rodzeństwo, bo z
  • Odpowiedz
@CrtZ: czy te statystyki opierają się na zameldowaniu? Jeśli tak to są lekko przekłamane. Od trzech lat nie mieszkam z rodzicami, ale zameldowana jestem w domu rodzinnym.
  • Odpowiedz
scrapowanie przeszlo pomyslnie, 2793 strony głównej z wykopaliskami, komentarzami, odpowiedziami do komentarzy + hashtagi, zawołania, nawet kolor nicka udało się wyciągnąć - łącznie jakieś 3,5gb danych do analizy ( ͡° ͜ʖ ͡°)

teraz pora na oczyszczenie danych i text mining komentarzy na wykopie ( ͡° ͜ʖ ͡°)

#dataisbeautiful #machinelearning #statystyka #python #apachespark #bigdata
kodi1911 - scrapowanie przeszlo pomyslnie, 2793 strony głównej z wykopaliskami, komen...

źródło: comment_iHqByudjm3hG5YvdN42R9ngcjVtdGy12.jpg

Pobierz
  • 28
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

Mireczki, korelacja na próbce n~100 wyszła nieistotna i słaba, ale powyżej pewnych wartości X staje się istotna i dość silna. Pytanie czy mogę sobie odciąć pomiary powyżej tej wartości i je osobno zinterpretować (tylko wtedy n spada do 18) i jeśli tak, to czy jest jakaś metoda statystyczna wyznaczenia wartości X, która rozgraniczy mi najlepiej korelację? Pic rel wybrałem sobie wartość na oko (czerwona linia).

A może takie postępowanie jest niecne (
t.....e - Mireczki, korelacja na próbce n~100 wyszła nieistotna i słaba, ale powyżej ...

źródło: comment_41wRYM2qEEdZ3uOoKydhv7wE7uCVIMtP.jpg

Pobierz
  • 9
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

@takie_chwile_jak_te: Nie podałeś wartości R sprzed i po. Wywalenie 80 obserwacji z kawałkiem nie wchodzi w grę. Wywalenie 4-5 ze 100 jak najbardziej, jeśli są odstające. Uważam, że jest dozwolone, ale pod warunkiem, że podasz wykres i wartości dla początkowego zbioru i znajdziesz dobrą przyczynę, dla której tak go przeorałeś i nie może być nią śrubowanie istotności.

Po drugie, moim zdaniem jest pożądane w jakich przedziałach wartości stają się istotne,
  • Odpowiedz
@shadowboxer: Dzięki za pomoc, to naprawdę przydatne co piszesz. Jeśli nie szkoda Ci czasu to jeszcze mam pytania:
- jakie wartości można uznać za odstające? Wyobrażam sobie, że jeśli próba n=100 to wartości wykraczające poza 3 odchylenia standardowe są mało prawdopodobne, ale czy jest tutaj jakaś reguła?
- nadal nie wiem czy jest jakaś dobra metoda poza 'na oko' wydzielania zbiorów?
  • Odpowiedz
Mirki z #statystyka, #gus, #ekonomia, wiecie może dlaczego w danych z dochodów budżetu państwa zawsze między grudniem roku X a styczniem X+1 jest taki uskok? Czytałem, że dolicza się wpłatę z zysku NBP, ale podobno w 2008 i 2009 taka wpłata wynosiła 0zł, a między grudniem 2008 a styczniem 2009 jest różnica aż 9mld zł.
  • 3
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

@plumkajacy_kalafior: uskok w dochodach budżetu państwa. Np. grudzień 2006 - 17mld, styczeń 2007 - 22mld luty 2007 - 15,8mld
grudzień 2008 - 18,5mld, styczeń 2009 - 27,7mld luty 2009 - 19mld
prawie zawsze jest taka wielka różnica między styczniem a resztą miesięcy. Innym miesiącem który też się wyróżnia jest kwiecień, ale w kwietniu chyba rozlicza się pity czy coś i to dlatego
  • Odpowiedz
Mirki pomóżcie, mam ankietę gdzie 100 osób mogło wybrać kilka odpowiedzi w jednym pytaniu. Za pomocą wykresu chce przedstawić ile % osób odpowiedziało na konkretną odpowiedź. Jak zaznaczę dane i zrobię wykres kołowy to wypluwa mi ile to było % głosów na konkretną odpowiedź ze wszystkich, a nie o to mi chodzi przecież.
#excel #informatyka #statystyka
  • 3
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach