sql >> Database >  >> RDS >> Mysql

Tabel hervormen in MySQL of R

In grondtal R zou de te gebruiken functie reshape . zijn , en u zou uw gegevens van "lang" naar "breed" converteren.

reshape(mydf, direction = "wide", idvar="perid", timevar="date")
#   perid rating.2005 rating.2006 rating.2007 rating.2008 rating.2009 rating.2010 rating.2011
# 1 10001          RD          GN          GD        <NA>        <NA>        <NA>        <NA>
# 4 10002        <NA>        <NA>        <NA>          GD          YW          GN          GN
# 8 10003          GD          GN          YW        <NA>        <NA>        <NA>        <NA>

U kunt ook kijken naar dcast uit het "reshape2" pakket en probeer:

library(reshape2)
dcast(mydf, perid ~ date, value.var="rating")
#   perid 2005 2006 2007 2008 2009 2010 2011
# 1 10001   RD   GN   GD <NA> <NA> <NA> <NA>
# 2 10002 <NA> <NA> <NA>   GD   YW   GN   GN
# 3 10003   GD   GN   YW <NA> <NA> <NA> <NA>

Voor een betere snelheid converteert u uw data.frame naar een data.table en gebruik dcast.data.table in plaats daarvan.

library(reshape2)
library(data.table)
DT <- data.table(mydf)
dcast.data.table(DT, perid ~ date, value.var = "rating")
#    perid 2005 2006 2007 2008 2009 2010 2011
# 1: 10001   RD   GN   GD   NA   NA   NA   NA
# 2: 10002   NA   NA   NA   GD   YW   GN   GN
# 3: 10003   GD   GN   YW   NA   NA   NA   NA

Uit uw opmerkingen blijkt dat u dubbele waarden heeft in de combinaties van kolom 1 en 2, wat betekent dat standaard dcast gebruikt length als zijn aggregatiefunctie.

Om hier voorbij te komen, moet je een secundaire ID (of "tijd", eigenlijk) kolom maken, wat als volgt kan worden gedaan.

Eerst wat voorbeeldgegevens. Let op de dubbele combinatie van de eerste twee kolommen in rij 1 en 2.

mydf <- data.frame(
  period = c(10001, 10001, 10002, 10002, 10003, 10003, 10001, 10001),
  date = c(2005, 2005, 2006, 2007, 2005, 2006, 2006, 2007),
  rating = c("RD", "GN", "GD", "GD", "YW", "GN", "GD", "YN"))
mydf
#   period date rating
# 1  10001 2005     RD
# 2  10001 2005     GN
# 3  10002 2006     GD
# 4  10002 2007     GD
# 5  10003 2005     YW
# 6  10003 2006     GN
# 7  10001 2006     GD
# 8  10001 2007     YN

Wanneer u dcast probeert , het "telt" gewoon het nummer onder elke combinatie.

## Not what you want
dcast(mydf, period ~ date, value.var="rating")
# Aggregation function missing: defaulting to length
#   period 2005 2006 2007
# 1  10001    2    1    1
# 2  10002    0    1    1
# 3  10003    1    1    0

Beslis welke dubbele rij moet worden verwijderd, of, als alle gegevens in uw dataset thuishoren, voeg een "time"-variabele toe, zoals deze:

mydf$time <- ave(1:nrow(mydf), mydf$period, mydf$date, FUN = seq_along)
mydf
#   period date rating time
# 1  10001 2005     RD    1
# 2  10001 2005     GN    2
# 3  10002 2006     GD    1
# 4  10002 2007     GD    1
# 5  10003 2005     YW    1
# 6  10003 2006     GN    1
# 7  10001 2006     GD    1
# 8  10001 2007     YN    1

Nu, dcast zou goed moeten werken. Hier is een halflange versie...

dcast(mydf, period + time ~ date, value.var="rating")
#   period time 2005 2006 2007
# 1  10001    1   RD   GD   YN
# 2  10001    2   GN <NA> <NA>
# 3  10002    1 <NA>   GD   GD
# 4  10003    1   YW   GN <NA>

... en een halfbrede versie.

dcast(mydf, period ~ date + time, value.var="rating")
#   period 2005_1 2005_2 2006_1 2007_1
# 1  10001     RD     GN     GD     YN
# 2  10002   <NA>   <NA>     GD     GD
# 3  10003     YW   <NA>     GN   <NA>


  1. Maximale rij in groep krijgen?

  2. MySQL 5.6 DATETIME accepteert geen milliseconden/microseconden

  3. MySQL-georuimtelijk zoeken met behulp van de haversine-formule retourneert null op hetzelfde punt

  4. MySQL-verschil tussen twee rijen van een SELECT-instructie