Jakie są główne wyniki składowe (wyniki PC, wyniki
Jakie są główne wyniki składowe (wyniki PC, wyniki
Wydaje się, że eksploracja danych i uczenie maszynowe stały się tak popularne, że teraz prawie każdy student CS wie o klasyfikatorach, klastrowaniu, statystycznym NLP ... itd. Wygląda więc na to, że znalezienie eksploratorów danych nie jest obecnie trudną sprawą. Moje pytanie brzmi: jakie...
Jak mogę usunąć zduplikowane wiersze z tej przykładowej ramki danych? A 1 A 1 A 2 B 4 B 1 B 1 C 2 C 2 Chciałbym usunąć duplikaty na podstawie obu kolumn: A 1 A 2 B 4 B 1 C 2 Porządek nie jest
Dla badań symulacyjnych mam do generowania zmiennych losowych, które wykazują prefined (populacji) korelację do istniejącej zmiennej .YYY I spojrzał w Ropakowaniach copula, a CDVinektóre mogą powodować przypadkowe wielowymiarowych rozkładów danej struktury zależności. Nie można jednak naprawić...
Szacunkowy współczynnik regresji grzbietu to wartości, które minimalizująβ^Rβ^R\hat{\beta}^R RSS+λ∑j=1pβ2j.RSS+λ∑j=1pβj2. \text{RSS} + \lambda \sum_{j=1}^p\beta_j^2. Moje pytania to: Jeśli , to widzimy, że powyższe wyrażenie redukuje się do zwykłego RSS. Co jeśli ? Nie rozumiem wyjaśnienia...
Na kursie uczenia maszynowego Andrew Nga wprowadza regresję liniową i regresję logistyczną oraz pokazuje, jak dopasować parametry modelu za pomocą spadku gradientu i metody Newtona. Wiem, że zejście gradientowe może być przydatne w niektórych aplikacjach uczenia maszynowego (np. Propagacja...
To pytanie zostało wywołane przez coś, co przeczytałem w tym podręczniku do statystyki dla absolwentów, a także (niezależnie) usłyszałem podczas tej prezentacji na seminarium statystycznym. W obu przypadkach stwierdzenie było zgodne z „ponieważ wielkość próbki jest dość mała, postanowiliśmy...
Pytanie: Czy są jakieś dobre przykłady powtarzalnych badań z wykorzystaniem R, które są bezpłatnie dostępne online? Idealny przykład: W szczególności idealne przykłady zapewniłyby: Surowe dane (i najlepiej metadane wyjaśniające dane), Cały kod R, w tym import danych, przetwarzanie, analizy i...
Pytanie: Chcę się czegoś upewnić, czy stosowanie k-krotnej walidacji krzyżowej z szeregami czasowymi jest proste, czy też należy na to zwrócić szczególną uwagę? Tło: modeluję 6-letni szereg czasowy (z łańcuchem pół-markowa), z próbką danych co 5 minut. Aby porównać kilka modeli, używam 6-krotnej...
Ekonometria w znacznym stopniu pokrywa się z tradycyjnymi statystykami, ale często używa własnego żargonu na różne tematy („identyfikacja”, „egzogeniczny” itp.). Kiedyś usłyszałem, jak profesor statystyki stosowanej w innym polu skomentował, że często terminologia jest inna, ale pojęcia są takie...
W kwietniu uczestniczyłem w przemówieniu na cyklicznym seminarium grupowym UMD Math Department Statistics zatytułowanym „Wyjaśnić czy przewidzieć?”. Rozmowę wygłosił prof. Galit Shmueli, który wykłada w Smith Business School w UMD. Jej przemówienie opierało się na badaniach, które przeprowadziła...
Kanoniczna analiza korelacji (CCA) jest techniką związaną z analizą głównych składników (PCA). Chociaż łatwo jest nauczyć się PCA lub regresji liniowej za pomocą wykresu punktowego (zobacz kilka tysięcy przykładów w wyszukiwaniu obrazów w Google), nie widziałem podobnego intuicyjnego dwuwymiarowego...
Ciekawe, dla tych z was, którzy mają duże doświadczenie we współpracy z innymi badaczami, jakie są najczęstsze nieporozumienia na temat regresji liniowej, które napotykasz? Myślę, że może to być przydatne ćwiczenie, aby pomyśleć o typowych nieporozumieniach przed czasem, aby to zrobić...
Obecnie pracuję nad quasi-eksperymentalnym artykułem badawczym. Mam tylko 15-osobową próbkę ze względu na małą populację w wybranym obszarze i tylko 15 spełnia moje kryteria. Czy 15 to minimalny rozmiar próbki do obliczenia dla testu t i testu F. Jeśli tak, to gdzie mogę uzyskać artykuł lub książkę...
Dlaczego w wielokrotnej regresji liniowej możliwe jest uzyskanie bardzo istotnej statystyki F (p <0,001), ale bardzo wysokich wartości p we wszystkich testach t regresora? W moim modelu jest 10 regresorów. Jeden ma wartość p 0,1, a reszta jest powyżej 0,9 Aby poradzić sobie z tym problemem,...
Jakie są obecnie dostępne niektóre cenne projekty open source do analizy statystycznej? Edycja: jak wskazał Sharpie, wartościowe mogą oznaczać pomoc w wykonywaniu zadań szybciej lub
Epoka stochastycznego spadku gradientu jest definiowana jako pojedyncze przejście przez dane. Dla każdego minibatchu SGD rysuje się kkk próbek, oblicza gradient i aktualizuje parametry. W ustawieniu epoki próbki są rysowane bez zamiany. Ale to wydaje się niepotrzebne. Dlaczego nie narysować...
Jaka jest odpowiednia strategia podziału zestawu danych? Pytam o opinie na następujące podejście (nie na poszczególnych parametrów, takich jak test_sizeczy n_iter, ale jeśli kiedyś X, y, X_train, y_train, X_test, a y_testwłaściwie i czy sekwencja ma sens): (rozszerzenie tego przykładu z...
Porównałem ?prcompi ?princompznalazłem coś na temat analizy głównego składnika w trybie Q i R (PCA). Ale szczerze mówiąc - nie rozumiem tego. Czy ktoś może wyjaśnić różnicę, a może nawet wyjaśnić, kiedy
Zauważyłem, że przedział ufności dla przewidywanych wartości w regresji liniowej jest zwykle wąski wokół średniej predyktora, a tłuszcz wokół minimalnych i maksymalnych wartości predyktora. Można to zobaczyć na wykresach tych 4 regresji liniowych: Początkowo myślałem, że dzieje się tak, ponieważ...