botoとpandasを使用してaws s3からcsvファイルを読み取る

Question

利用可能な回答 here および here をすでに読みましたが、これらは役に立ちません。

S3バケットからcsvオブジェクトを読み取ろうとしていますが、次のコードを使用してデータを正常に読み取ることができました。

srcFileName="gossips.csv" def on_session_started(): print("Starting new session.") conn = S3Connection() my_bucket = conn.get_bucket("randomdatagossip", validate=False) print("Bucket Identified") print(my_bucket) key = Key(my_bucket,srcFileName) key.open() print(key.read()) conn.close() on_session_started()

ただし、pandasをデータフレームとして使用して同じオブジェクトを読み取ろうとすると、エラーが発生します。最も一般的なのはS3ResponseError: 403 Forbiddenです。

def on_session_started2(): print("Starting Second new session.") conn = S3Connection() my_bucket = conn.get_bucket("randomdatagossip", validate=False) # url = "https://s3.amazonaws.com/randomdatagossip/gossips.csv" # urllib2.urlopen(url) for line in smart_open.smart_open('s3://my_bucket/gossips.csv'): print line # data = pd.read_csv(url) # print(data) on_session_started2()

何が悪いのですか？私はpython 2.7を使用しており、Python 3.を使用できません。

Drj · Accepted Answer

これは、S3でdfからcsvを正常に読み取るために私が行ったことです。

import pandas as pd import boto3 bucket = "yourbucket" file_name = "your_file.csv" s3 = boto3.client('s3') # 's3' is a key Word. create connection to S3 using default config and all buckets within S3 obj = s3.get_object(Bucket= bucket, Key= file_name) # get object and file (key) from bucket initial_df = pd.read_csv(obj['Body']) # 'Body' is a key Word

aidan.plenert.macdonald · Answer

これでうまくいきました。

import pandas as pd import boto3 import io s3_file_key = 'data/test.csv' bucket = 'data-bucket' s3 = boto3.client('s3') obj = s3.get_object(Bucket=bucket, Key=s3_file_key) initial_df = pd.read_csv(io.BytesIO(obj['Body'].read()))