In [1]:

    
import pandas as pd
import numpy as np
import re as re

train = pd.read_csv('train.csv')
test = pd.read_csv('test.csv')
full_data = [train,test]

train.info()
print("**********************************************")
print(test.info())









    



<class 'pandas.core.frame.DataFrame'>
RangeIndex: 891 entries, 0 to 890
Data columns (total 12 columns):
PassengerId    891 non-null int64
Survived       891 non-null int64
Pclass         891 non-null int64
Name           891 non-null object
Sex            891 non-null object
Age            714 non-null float64
SibSp          891 non-null int64
Parch          891 non-null int64
Ticket         891 non-null object
Fare           891 non-null float64
Cabin          204 non-null object
Embarked       889 non-null object
dtypes: float64(2), int64(5), object(5)
memory usage: 83.6+ KB
**********************************************
<class 'pandas.core.frame.DataFrame'>
RangeIndex: 418 entries, 0 to 417
Data columns (total 11 columns):
PassengerId    418 non-null int64
Pclass         418 non-null int64
Name           418 non-null object
Sex            418 non-null object
Age            332 non-null float64
SibSp          418 non-null int64
Parch          418 non-null int64
Ticket         418 non-null object
Fare           417 non-null float64
Cabin          91 non-null object
Embarked       418 non-null object
dtypes: float64(2), int64(4), object(5)
memory usage: 36.0+ KB
None

1. Feature Engineering



In [2]:

    
train[['Pclass', 'Survived']].groupby(['Pclass']).mean() #, as_index=False



In [3]:

    
train[["Sex", "Survived"]].groupby(['Sex']).mean()



In [4]:

    
for dataset in full_data:
    dataset['FamilySize'] = dataset['SibSp'] + dataset['Parch'] + 1

for dataset in full_data:
    dataset['IsAlone'] = 0
    dataset.loc[dataset['FamilySize'] == 1, 'IsAlone'] = 1
train[['IsAlone', 'Survived']].groupby(['IsAlone']).mean()



In [5]:

    
for dataset in full_data:
    dataset['Embarked'] = dataset['Embarked'].fillna('S')
train[['Embarked', 'Survived']].groupby(['Embarked']).mean()



In [6]:

    
for dataset in full_data:
    dataset['Fare'] = dataset['Fare'].fillna(train['Fare'].median())
train['CategoricalFare'] = pd.qcut(train['Fare'], 4)
train[['CategoricalFare', 'Survived']].groupby(['CategoricalFare']).mean()









    Out[6]:







  
    
      
      Survived
    
    
      CategoricalFare
      
    
  
  
    
      (-0.001, 7.91]
      0.197309
    
    
      (7.91, 14.454]
      0.303571
    
    
      (14.454, 31.0]
      0.454955
    
    
      (31.0, 512.329]
      0.581081



In [7]:

    
for dataset in full_data:
    age_avg  = dataset['Age'].mean()
    age_std  = dataset['Age'].std()
    age_null_count = dataset['Age'].isnull().sum()
    
    age_null_random_list = np.random.randint(age_avg - age_std, age_avg + age_std, size=age_null_count)
    dataset['Age'][np.isnan(dataset['Age'])] = age_null_random_list
    dataset['Age'] = dataset['Age'].astype(int)
    
train['CategoricalAge'] = pd.qcut(train['Age'], 5)

train[['CategoricalAge', 'Survived']].groupby(['CategoricalAge']).mean()









    



c:\program files\python36\lib\site-packages\ipykernel_launcher.py:7: SettingWithCopyWarning: 
A value is trying to be set on a copy of a slice from a DataFrame

See the caveats in the documentation: http://pandas.pydata.org/pandas-docs/stable/indexing.html#indexing-view-versus-copy
  import sys






    Out[7]:







  
    
      
      Survived
    
    
      CategoricalAge
      
    
  
  
    
      (-0.001, 19.0]
      0.479798
    
    
      (19.0, 25.0]
      0.317919
    
    
      (25.0, 32.0]
      0.377049
    
    
      (32.0, 40.0]
      0.370588
    
    
      (40.0, 80.0]
      0.359281



In [8]:

    
def get_title(name):
    title_search = re.search(' ([A-Za-z]+)\.', name)
    # If the title exists, extract and return it.
    if title_search:
        return title_search.group(1)
    return ""

for dataset in full_data:
    dataset['Title'] = dataset['Name'].apply(get_title)

pd.crosstab(train['Title'], train['Sex'])



In [9]:

    
for dataset in full_data:
    dataset['Title'] = dataset['Title'].replace(['Lady', 'Countess','Capt', 'Col','Don', 'Dr', 'Major', 'Rev', 'Sir', 'Jonkheer', 'Dona'], 'Rare')
    dataset['Title'] = dataset['Title'].replace('Mlle', 'Miss')
    dataset['Title'] = dataset['Title'].replace('Ms', 'Miss')
    dataset['Title'] = dataset['Title'].replace('Mme', 'Mrs')

train[['Title', 'Survived']].groupby(['Title']).mean()

2. Data Mapping + Cleaning



In [10]:

    
for dataset in full_data:
    # Mapping Sex
    dataset['Sex'] = dataset['Sex'].map( {'female': 0, 'male': 1} )
    
    # Mapping titles
    dataset['Title'] = dataset['Title'].map({"Mr": 0, "Miss": 1, "Mrs": 2, "Master": 3, "Rare": 4})
    dataset['Title'] = dataset['Title'].fillna(0)
    
    # Mapping Embarked
    dataset['Embarked'] = dataset['Embarked'].map( {'S': 0, 'C': 1, 'Q': 2} )
    
    # Mapping Fare
    dataset.loc[ dataset['Fare'] <= 7.91, 'Fare'] = 0
    dataset.loc[(dataset['Fare'] > 7.91) & (dataset['Fare'] <= 14.454), 'Fare'] = 1
    dataset.loc[(dataset['Fare'] > 14.454) & (dataset['Fare'] <= 31), 'Fare']   = 2
    dataset.loc[ dataset['Fare'] > 31, 'Fare'] = 3
    dataset['Fare'] = dataset['Fare'].astype(int)
    
    # Mapping Age
    dataset.loc[ dataset['Age'] <= 16, 'Age'] = 0
    dataset.loc[(dataset['Age'] > 16) & (dataset['Age'] <= 32), 'Age'] = 1
    dataset.loc[(dataset['Age'] > 32) & (dataset['Age'] <= 48), 'Age'] = 2
    dataset.loc[(dataset['Age'] > 48) & (dataset['Age'] <= 64), 'Age'] = 3
    dataset.loc[ dataset['Age'] > 64, 'Age'] = 4
    
# Feature Selection
drop_elements = ['PassengerId', 'Name', 'Ticket', 'Cabin', 'SibSp','Parch', 'FamilySize']
train = train.drop(drop_elements, axis = 1)
train = train.drop(['CategoricalAge', 'CategoricalFare'], axis = 1)
ids = test['PassengerId']
test  = test.drop(drop_elements, axis = 1)



In [11]:

    
print(train.info())
print("************************************")
print(test.info())
train = train.values
test  = test.values









    



<class 'pandas.core.frame.DataFrame'>
RangeIndex: 891 entries, 0 to 890
Data columns (total 8 columns):
Survived    891 non-null int64
Pclass      891 non-null int64
Sex         891 non-null int64
Age         891 non-null int32
Fare        891 non-null int32
Embarked    891 non-null int64
IsAlone     891 non-null int64
Title       891 non-null int64
dtypes: int32(2), int64(6)
memory usage: 48.8 KB
None
************************************
<class 'pandas.core.frame.DataFrame'>
RangeIndex: 418 entries, 0 to 417
Data columns (total 7 columns):
Pclass      418 non-null int64
Sex         418 non-null int64
Age         418 non-null int32
Fare        418 non-null int32
Embarked    418 non-null int64
IsAlone     418 non-null int64
Title       418 non-null int64
dtypes: int32(2), int64(5)
memory usage: 19.7 KB
None



In [12]:

    
from sklearn.linear_model import LogisticRegression
from sklearn.neighbors import KNeighborsClassifier
from sklearn.svm import SVC
from sklearn.naive_bayes import GaussianNB
from sklearn.tree import DecisionTreeClassifier
from sklearn.ensemble import RandomForestClassifier, AdaBoostClassifier, GradientBoostingClassifier
from sklearn.discriminant_analysis import LinearDiscriminantAnalysis, QuadraticDiscriminantAnalysis

from sklearn.model_selection import StratifiedShuffleSplit
from sklearn.metrics import accuracy_score



In [13]:

    
classifiers = [
    LogisticRegression(random_state = 0),
    KNeighborsClassifier(n_neighbors = 3),
    SVC(kernel = 'rbf', random_state = 0),
    GaussianNB(),
    DecisionTreeClassifier(criterion = 'entropy', random_state = 0),
    RandomForestClassifier(n_estimators = 10, criterion = 'entropy', random_state = 0),
    AdaBoostClassifier(random_state=0),
    GradientBoostingClassifier(random_state=0),
    LinearDiscriminantAnalysis(),
    QuadraticDiscriminantAnalysis()]

sss = StratifiedShuffleSplit(n_splits=10, test_size=0.1, random_state=0)

X = train[:,1:]
y = train[:,0]

acc_dict = {}

for train_index, test_index in sss.split(X, y):
    X_train, X_test = X[train_index], X[test_index]
    y_train, y_test = y[train_index], y[test_index]
    
    for clf in classifiers:
        name = clf.__class__.__name__
        clf.fit(X_train, y_train)
        train_predictions = clf.predict(X_test)
        acc = accuracy_score(y_test, train_predictions)
        if name in acc_dict:
            acc_dict[name] += acc
        else:
            acc_dict[name] = acc

for clf in acc_dict:
    acc_dict[clf] = acc_dict[clf] / 10.0
    print(clf)
    print(acc_dict[clf])









    



LogisticRegression
0.79
KNeighborsClassifier
0.796666666667
SVC
0.818888888889
GaussianNB
0.775555555556
DecisionTreeClassifier
0.808888888889
RandomForestClassifier
0.816666666667
AdaBoostClassifier
0.801111111111
GradientBoostingClassifier
0.815555555556
LinearDiscriminantAnalysis
0.786666666667
QuadraticDiscriminantAnalysis
0.801111111111



In [14]:

    
candidate_classifier = SVC(kernel = 'rbf', random_state = 0)
candidate_classifier.fit(train[0::, 1::], train[0::, 0])
result = candidate_classifier.predict(test)

submission = pd.DataFrame({
        "PassengerId": ids,
        "Survived": result
    })
submission.to_csv('svc.csv', index=False)
print("done")









    



done

	Survived
Pclass
1	0.629630
2	0.472826
3	0.242363

	Survived
Embarked
C	0.553571
Q	0.389610
S	0.339009

	Survived
CategoricalFare
(-0.001, 7.91]	0.197309
(7.91, 14.454]	0.303571
(14.454, 31.0]	0.454955
(31.0, 512.329]	0.581081

	Survived
CategoricalAge
(-0.001, 19.0]	0.479798
(19.0, 25.0]	0.317919
(25.0, 32.0]	0.377049
(32.0, 40.0]	0.370588
(40.0, 80.0]	0.359281

Sex	female	male
Title
Capt	0	1
Col	0	2
Countess	1	0
Don	0	1
Dr	1	6
Jonkheer	0	1
Lady	1	0
Major	0	2
Master	0	40
Miss	182	0
Mlle	2	0
Mme	1	0
Mr	0	517
Mrs	125	0
Ms	1	0
Rev	0	6
Sir	0	1

	Survived
Title
Master	0.575000
Miss	0.702703
Mr	0.156673
Mrs	0.793651
Rare	0.347826