1

大規模なデータセットで次の操作を行うのに問題があります。ffまたはffdfのいずれかでそれを行う組み込みの方法があるのだろうか。

例: substr を使用して ffdf オブジェクトの文字列を変更し、別の列として再割り当てします。

require(ffbase)
> iris
    Sepal.Length Sepal.Width Petal.Length Petal.Width    Species
1            5.1         3.5          1.4         0.2     setosa
2            4.9         3.0          1.4         0.2     setosa
3            4.7         3.2          1.3         0.2     setosa
4            4.6         3.1          1.5         0.2     setosa

#Convert to ff object
A <- as.ffdf(iris)

「種」列にアクセスできます

A$species
> A$Species
ff (open) integer length=150 (150) levels: setosa versicolor virginica
      [1]       [2]       [3]       [4]       [5]       [6]       [7]       [8]               [143]     [144] 
setosa    setosa    setosa    setosa    setosa    setosa    setosa    setosa            : virginica virginica 
    [145]     [146]     [147]     [148]     [149]     [150] 
virginica virginica virginica virginica virginica virginica

しかし、たとえば、文字 1 から 3 をサブストリング化したい場合、次のエラーが発生します。

> substr(as.character(A$Species),1,3)
Error in substr(as.character(A$Species), 1, 3) : 
  extracting substrings from a non-character object 

ffdf オブジェクトの列を変更するためのガイドラインは何ですか?

編集

また、ffdfdply アプローチも試しました。かなり小さいデータの場合、非常に時間がかかるようです。

substrff <- function(x){
  x$new <- substr(x$Species,1,8)
  return(x)
}

B <-  ffdfdply(x=A, split = A$Species, FUN = substrff)
4

1 に答える 1

2
require(ffbase)
data(iris, package = "datasets")
x <- as.ffdf(iris)
x$spec <- with(x[c("Species")], substr(Species, 1, 4))
于 2017-04-06T11:49:46.600 に答える