Rでは（まだ）parquetファイルが読み込めない

R Windows

PythonでのDataFrameの保存方法としてCSVは卒業してparquet+zstdにしようと思っているのですが、どうやら日本語環境のWindowsだとRで読み込めない模様 Rのarrowパッケージのread_parquetでparquet形式ファイルは読み込めるはずですが、フリーズしてしまいま…

2020-08-23

データ操作まとめ（R dplyrとPython pandasで）

Python R

irisデータセットを使ってRとPythonのデータフレームの操作方法の比較バージョン準備 R Python (列の)選択 R Python 抽出(filter) R Python カテゴリ化 R Python 集計 R Python 集計値を新規カラムとして追加 R Python バージョン R R 4.0.2 dplyr 1.0.1 P…

2020-07-20

MonetDB+R：入力文字列 5 はこのロケールでは不適切です

MonetDB R Windows

内容ポピュラーなDBは使っているOSに合わせたエンコーディングで結果を返してくれるがMonetDBはUTF-8固定なので、RODBCをオプションなしで使うと文字化けが発生する。 Warning message in FUN(X[[i]], ...): " 入力文字列 5 はこのロケールでは不適切です …

2020-07-04

クロス集計表

R

Rでずっと使っているクロス集計表の話です。 3年前くらいにネットを漁ってブログを見つけ、コードを.Rprofileにコピペして使っています。記事を書くにあたり改めてブログを拝見したら、林真広さんという「M-plusとRによる構造方程式モデリング入門」の共著…

2020-07-01

本当に必要なグラフの描き方(ggplot2編)

R

TableauやGoogle Data Studioなど、BIツールを利用するようになって思ったこと。「もう、ggplotで目盛りの細かい調節をしたり、カラーコードを一生懸命調べたりしなくても、視覚化はこいつらに任せればいいな…」少なくとも自分にとっては、ggplotのメインの…

2020-06-30

RとvariableInspector混ぜるな危険

R Python jupyter

jupyter notebook/Lab の便利な拡張variableInspectorは、jupyterでR環境を使う人は入れてはいけない variableInspectorはRにも対応しているが、そのプロセスでglobal環境にある全てのオブジェクトを読むところがあるらしく、巨大なdata.frameが存在するとそ…

2020-06-28

疎行列同士の最大最小

R

疎行列(SparseMatrix) 数百万個の各インプットに対して、数万個のキーワードの有無をフラグ化したいインプットを行、キーワードを列にTrue/Falseを値として持つ行列とみなせる。しかし、普通の行列（密行列）ではメモリ不足＆重い疎行列を使うべきアソシ…

2020-06-27

data.table

R

普段はデータの加工にdata.frame(dplyr, tidyr等)の関数を使うのだが処理速度の観点からdata.tableの構文を使いたいこともあり基本 dt[行フィルタリング, 列操作, Grouping] 列操作において x:= の構文を用いると、その結果を返すのでなく、元のdata.table…

2020-06-27

Rの環境設定

R

Rの環境変数についての記事があまりなく、備忘最近はRenvなども出ているが、個人的にはRはやっぱり実験的環境プロダクトにするなら、Python+pipenvの方が向いてる気がする。参考 amano41.hatenablog.jp

2020-06-27

factor

R

Rのfactor型は難しい。なのでstringsAsFactors=Fがデフォルトですが、メリデメを整理してみた。メリット summary()したときに、カテゴリ別の件数を表示してくれる。 ggplotしたときに、データが存在しないカテゴリに関しても描画してくれる。 sort順の指定…

2020-06-27

jupyterで日本語

Python R jupyter Windows

jupyter環境では特に設定しないとグラフの日本語（軸ラベル等）が□に文字化けしてしまう。日本語を表示する方法について整理この設定はAnacondaを使っている場合なので純粋なPythonの場合は適宜パスを読替え Python matplotlib の設定ファイルを修正~~~\Li…

2020-06-27

PythonとＲの違い

Python R

いつもよく忘れることのメモ整数の除算 R 除算：%/% 剰余：%% Python3 除算：// 剰余：% SQL 除算：/ (INT型の場合) 剰余：mod λ式 R ~ f(.) Python lambda x: f(x)

2020-06-26

特定の文字を入力するとIRkernelがフリーズする

jupyter R Windows

現象日本語Windows、つまり文字コードShift-JIS(CP932)環境下のjupyter+Rで特定の文字を表示しようとするとフリーズする。 Windows(Shift-JIS)+jupyter+R というのがミソ。Pythonなら発生しないし、IRkernel+Linuxでも発生しない。具体的にはSJISで**5Cと…

R, Python, DB 備忘録

データベースとか、jupyter(Python)、Rとか色々

R

Rでは（まだ）parquetファイルが読み込めない

データ操作まとめ（R dplyrとPython pandasで）

MonetDB+R：入力文字列 5 はこのロケールでは不適切です

クロス集計表

本当に必要なグラフの描き方(ggplot2編)

RとvariableInspector混ぜるな危険

疎行列同士の最大最小

data.table

Rの環境設定

factor

jupyterで日本語

PythonとＲの違い

特定の文字を入力するとIRkernelがフリーズする