2

Spark を使用して Cassandra からデータを読み込もうとしています。

    DataFrame rdf = sqlContext.read().option("keyspace", "readypulse")
            .option("table", "ig_posts")
            .format("org.apache.spark.sql.cassandra").load();

    rdf.registerTempTable("cassandra_table");
    System.out.println(sqlContext.sql("select count(external_id) from cassandra_table").collect()[0].getLong(0));

タスクは次のエラーで失敗します。ShuffleMaptask が呼び出されている理由と、それを Task にキャストすることが問題である理由を理解できません。

16/03/30 02:27:15 WARN TaskSetManager: Lost task 1.0 in stage 0.0 (TID 1, ip-10-165-180-22.ec2.internal): 
            java.lang.ClassCastException: 
            org.apache.spark.scheduler.ShuffleMapTask 
                cannot be cast to org.apache.spark.scheduler.Task
                        at org.apache.spark.executor.Executor$TaskRunner.run(Executor.scala:193)
                        at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1145)
                        at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:615)
                        at java.lang.Thread.run(Thread.java:745)
16/03/30 02:27:15 INFO TaskSetManager: Lost task 0.0 in stage 0.0 (TID 0) on executor ip-10-165-180-22.ec2.internal: 
            java.lang.ClassCastException (org.apache.spark.scheduler.Shuf
                fleMapTask 
            cannot be cast to org.apache.spark.scheduler.Task) [duplicate 1]

16/03/30 02:27:15 ERROR TaskSetManager: Task 0 in stage 0.0 failed 4 times; aborting job

EMR 4.4、Spark 1.6、Cassandra 2.2 (Datastax Community)、および spark-cassandra-connector-java_2.10 1.6.0-M1 (1.5.0 も試しました) を使用しています。

次のコードでも同じことを試しましたが、同じエラーが発生しました。

    CassandraJavaRDD<CassandraRow> cjrdd = functions.cassandraTable(
            KEYSPACE, tableName).select(columns);
    logger.info("Got rows from cassandra " + cjrdd.count());

    JavaRDD<Double> jrdd2 = cjrdd.map(new Function<CassandraRow, Double>() {
        @Override
        public Double call(CassandraRow trainingRow) throws Exception {
            Object fCount = trainingRow.getRaw("follower_count");
            double count = 0;
            if (fCount != null) {
                count = (Long) fCount;
            }
            return count;
        }
    });
    logger.info("Mapper done : " + jrdd2.count());
    logger.info("Mapper done values : " + jrdd2.collect());
4

2 に答える 2