summary의 결과물 - type III

작성자안재형|작성시간14.03.19|조회수559 목록 댓글 6

이 p-value들은 전체 모형에서 특정변수 하나를 뺐을때 그 변수의 유의성을 평가해줍니다.

이런걸 type III라고 합니다.


> out=lm(bwt~age+lwt+factor(race),data=birthwt)
> summary(out)

Call:
lm(formula = bwt ~ age + lwt + factor(race), data = birthwt)

Residuals:
     Min       1Q   Median       3Q      Max
-2103.50  -429.68    41.74   486.10  1902.20

Coefficients:
              Estimate Std. Error t value Pr(>|t|)   
(Intercept)   2461.147    314.722   7.820 3.97e-13 ***
age              1.299     10.108   0.128  0.89789   
lwt              4.620      1.788   2.584  0.01054
factor(race)2 -447.615    161.369  -2.774  0.00611 **
factor(race)3 -239.357    115.189  -2.078  0.03910 * 
---
Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 704.9 on 184 degrees of freedom
Multiple R-squared:  0.08536,   Adjusted R-squared:  0.06548
F-statistic: 4.293 on 4 and 184 DF,  p-value: 0.00241

변수하나씩 빼고 돌려보죠.
> out1=lm(bwt~lwt+factor(race),data=birthwt)
> out2=lm(bwt~age+factor(race),data=birthwt)
> out3=lm(bwt~age+lwt,data=birthwt)


age를 뺀 모형과 있는 모형을 비교하면 p-value=0.8979로 summary(out)의 결과와 동일합니다.
> anova(out,out1)
Analysis of Variance Table

Model 1: bwt ~ age + lwt + factor(race)
Model 2: bwt ~ lwt + factor(race)
  Res.Df      RSS Df Sum of Sq      F Pr(>F)
1    184 91436202                          
2    185 91444408 -1   -8205.4 0.0165 0.8979


lwt도 마찬가지입니다.
> anova(out,out2)
Analysis of Variance Table

Model 1: bwt ~ age + lwt + factor(race)
Model 2: bwt ~ age + factor(race)
  Res.Df      RSS Df Sum of Sq      F  Pr(>F) 
1    184 91436202                             
2    185 94754346 -1  -3318144 6.6772 0.01054 *
---
Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1


race는 1,2,3으로 셋입니다. 1,2,3 차이가 없는지 본거고,

summary(out)에서는 1을 reference로 "2-1"의 차이와 "3-1"의 차이를 각각본겁니다.
> anova(out,out3)
Analysis of Variance Table

Model 1: bwt ~ age + lwt + factor(race)
Model 2: bwt ~ age + lwt
  Res.Df      RSS Df Sum of Sq      F   Pr(>F)  
1    184 91436202                               
2    186 96186834 -2  -4750632 4.7799 0.009467 **
---
Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

다음검색
현재 게시글 추가 기능 열기

댓글

댓글 리스트
  • 답댓글 작성자안재형 작성자 본인 여부 작성자 | 작성시간 14.03.20 글쎄요^^ 그냥 full-model에서 한 변수의 중요성을 평가할때 사용됩니다. type III라고 기억하시면 됩니다.
  • 작성자국제미아 | 작성시간 14.03.20 오.. 그렇군요~ 거의 다 이해는 했는데 범주형자료 factor(race) 관련해선 아직도 아리까리 하네요; 그 변수가 빠졌을 때 그 영향의 유의수준인건데,,, 범주형 자료면 , factor(race)2 이면 2-1 의 차이, factor(race)3 이면 3-1의 차이를 보는 거라고 하신거 같은데.. 그럼 더미변수라고 생각해도 되는거 맞죠?... 값이 3개니까 더미변수는 2개가 되고,

    [race=1 이면 factor(race)2=0, factor(race)3=0
    / race=2 이면 factor(race)2=1, factor(race)3=0
    / race=3 이면 factor(race)2=0, factor(race)3=1 ]

    그것들의 p-value들은 더비변수 들이 빠졌을 때의 영향의 유의수준을 보는거 아닌가요?
  • 답댓글 작성자안재형 작성자 본인 여부 작성자 | 작성시간 14.03.20 그럴것같은데 한번 공부삼아 해보세요^^
  • 작성자국제미아 | 작성시간 14.03.20 그리고 anova 에서는 왜 안 쪼개지는지... 그건 그냥 통째로 보는건가요?
  • 답댓글 작성자안재형 작성자 본인 여부 작성자 | 작성시간 14.03.20 anova에서는 그 변수의 유의성을 보는거여서 한꺼번에 봅니다. one-way anova에서 overall test같은거죠. 두개를 한꺼번에 봐서 df=2이죠.
댓글 전체보기
맨위로

카페 검색

카페 검색어 입력폼