# 模式识别最简单的Python代码实现
模式识别作为机器学习的重要分支,在图像识别、语音处理、医疗诊断等领域有着广泛应用。下面通过几个简单但完整的Python示例来展示模式识别的基本实现方法。
## 1. K-近邻算法实现手写数字识别
K-近邻(KNN)是最直观的模式识别算法之一,特别适合初学者理解模式识别的基本原理。
```python
import numpy as np
from sklearn.datasets import load_digits
from sklearn.model_selection import train_test_split
from sklearn.neighbors import KNeighborsClassifier
from sklearn.metrics import accuracy_score
import matplotlib.pyplot as plt
# 加载手写数字数据集
digits = load_digits()
X = digits.data # 特征数据(64维像素值)
y = digits.target # 标签数据(0-9的数字)
# 划分训练集和测试集
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)
# 创建KNN分类器
knn = KNeighborsClassifier(n_neighbors=3)
# 训练模型
knn.fit(X_train, y_train)
# 预测测试集
y_pred = knn.predict(X_test)
# 计算准确率
accuracy = accuracy_score(y_test, y_pred)
print(f"KNN模型准确率: {accuracy:.4f}")
# 可视化一个测试样本
plt.figure(figsize=(8, 4))
plt.subplot(1, 2, 1)
plt.imshow(X_test[0].reshape(8, 8), cmap='gray')
plt.title(f'真实标签: {y_test[0]}')
plt.subplot(1, 2, 2)
plt.imshow(X_test[0].reshape(8, 8), cmap='gray')
plt.title(f'预测标签: {y_pred[0]}')
plt.show()
```
这个例子展示了使用KNN算法识别手写数字的完整流程,包括数据加载、模型训练、预测和评估[ref_1]。
## 2. 支持向量机实现简单分类
支持向量机(SVM)是另一种常用的模式识别算法,特别适合小样本数据的分类问题。
```python
from sklearn import datasets
from sklearn.svm import SVC
from sklearn.preprocessing import StandardScaler
import matplotlib.pyplot as plt
import numpy as np
# 生成简单的二维分类数据
X, y = datasets.make_classification(n_samples=100, n_features=2, n_redundant=0,
n_informative=2, n_clusters_per_class=1,
random_state=42)
# 数据标准化
scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)
# 创建SVM分类器
svm = SVC(kernel='linear', C=1.0)
# 训练模型
svm.fit(X_scaled, y)
# 可视化分类结果
plt.figure(figsize=(10, 6))
# 绘制数据点
plt.scatter(X_scaled[y==0, 0], X_scaled[y==0, 1], color='red', label='Class 0')
plt.scatter(X_scaled[y==1, 0], X_scaled[y==1, 1], color='blue', label='Class 1')
# 绘制决策边界
ax = plt.gca()
xlim = ax.get_xlim()
ylim = ax.get_ylim()
# 创建网格来评估模型
xx = np.linspace(xlim[0], xlim[1], 30)
yy = np.linspace(ylim[0], ylim[1], 30)
YY, XX = np.meshgrid(yy, xx)
xy = np.vstack([XX.ravel(), YY.ravel()]).T
Z = svm.decision_function(xy).reshape(XX.shape)
# 绘制决策边界和间隔
ax.contour(XX, YY, Z, colors='k', levels=[-1, 0, 1], alpha=0.5,
linestyles=['--', '-', '--'])
ax.scatter(svm.support_vectors_[:, 0], svm.support_vectors_[:, 1], s=100,
linewidth=1, facecolors='none', edgecolors='k')
plt.xlabel('Feature 1')
plt.ylabel('Feature 2')
plt.title('SVM分类结果可视化')
plt.legend()
plt.grid(True, alpha=0.3)
plt.show()
print(f"支持向量数量: {len(svm.support_vectors_)}")
```
这个例子展示了SVM在简单二维数据上的分类效果,包括决策边界和支持向量的可视化[ref_2]。
## 3. 决策树实现模式分类
决策树算法直观易懂,适合展示模式识别中的特征选择过程。
```python
from sklearn.tree import DecisionTreeClassifier, plot_tree
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
import matplotlib.pyplot as plt
# 加载鸢尾花数据集
iris = load_iris()
X = iris.data # 花萼长度、花萼宽度、花瓣长度、花瓣宽度
y = iris.target # 鸢尾花种类
# 划分训练集和测试集
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
# 创建决策树分类器
dtree = DecisionTreeClassifier(max_depth=3, random_state=42)
# 训练模型
dtree.fit(X_train, y_train)
# 预测并评估
accuracy = dtree.score(X_test, y_test)
print(f"决策树准确率: {accuracy:.4f}")
# 可视化决策树
plt.figure(figsize=(12, 8))
plot_tree(dtree, feature_names=iris.feature_names,
class_names=iris.target_names, filled=True)
plt.title('决策树可视化 - 鸢尾花分类')
plt.show()
# 显示特征重要性
feature_importance = dtree.feature_importances_
for i, (feature, importance) in enumerate(zip(iris.feature_names, feature_importance)):
print(f"{feature}: {importance:.4f}")
```
这个例子展示了决策树在鸢尾花分类中的应用,通过可视化可以清楚地看到分类决策过程[ref_1]。
## 4. 简单的聚类算法实现
K-均值聚类是最基础的无监督模式识别算法。
```python
from sklearn.cluster import KMeans
from sklearn.datasets import make_blobs
import matplotlib.pyplot as plt
import numpy as np
# 生成模拟数据
X, y_true = make_blobs(n_samples=300, centers=4, cluster_std=0.60, random_state=42)
# 创建K-均值聚类模型
kmeans = KMeans(n_clusters=4, random_state=42)
# 训练模型并进行预测
y_pred = kmeans.fit_predict(X)
# 可视化聚类结果
plt.figure(figsize=(12, 5))
plt.subplot(1, 2, 1)
plt.scatter(X[:, 0], X[:, 1], c=y_true, cmap='viridis')
plt.title('真实聚类分布')
plt.xlabel('Feature 1')
plt.ylabel('Feature 2')
plt.subplot(1, 2, 2)
plt.scatter(X[:, 0], X[:, 1], c=y_pred, cmap='viridis')
plt.scatter(kmeans.cluster_centers_[:, 0], kmeans.cluster_centers_[:, 1],
marker='x', s=200, linewidths=3, color='red')
plt.title('K-均值聚类结果')
plt.xlabel('Feature 1')
plt.ylabel('Feature 2')
plt.tight_layout()
plt.show()
print(f"聚类中心坐标:\n{kmeans.cluster_centers_}")
```
这个例子展示了K-均值聚类算法的基本应用,包括数据生成、模型训练和结果可视化[ref_5]。
## 5. 简单的神经网络实现
使用简单的神经网络进行模式识别。
```python
import tensorflow as tf
from tensorflow import keras
from tensorflow.keras import layers
import numpy as np
import matplotlib.pyplot as plt
# 加载Fashion MNIST数据集
(X_train, y_train), (X_test, y_test) = keras.datasets.fashion_mnist.load_data()
# 数据预处理
X_train = X_train.astype('float32') / 255.0
X_test = X_test.astype('float32') / 255.0
# 构建简单的神经网络模型
model = keras.Sequential([
layers.Flatten(input_shape=(28, 28)),
layers.Dense(128, activation='relu'),
layers.Dense(10, activation='softmax')
])
# 编译模型
model.compile(optimizer='adam',
loss='sparse_categorical_crossentropy',
metrics=['accuracy'])
# 训练模型
history = model.fit(X_train, y_train,
epochs=5,
batch_size=32,
validation_split=0.2,
verbose=1)
# 评估模型
test_loss, test_accuracy = model.evaluate(X_test, y_test, verbose=0)
print(f"测试集准确率: {test_accuracy:.4f}")
# 绘制训练过程
plt.figure(figsize=(12, 4))
plt.subplot(1, 2, 1)
plt.plot(history.history['accuracy'], label='训练准确率')
plt.plot(history.history['val_accuracy'], label='验证准确率')
plt.title('模型准确率')
plt.xlabel('Epoch')
plt.ylabel('Accuracy')
plt.legend()
plt.subplot(1, 2, 2)
plt.plot(history.history['loss'], label='训练损失')
plt.plot(history.history['val_loss'], label='验证损失')
plt.title('模型损失')
plt.xlabel('Epoch')
plt.ylabel('Loss')
plt.legend()
plt.show()
```
这个简单的神经网络例子展示了深度学习在模式识别中的应用,包括数据预处理、模型构建、训练和评估[ref_4]。
## 总结
以上五个例子涵盖了模式识别中最基础且重要的算法:
| 算法类型 | 示例算法 | 特点 | 适用场景 |
|---------|----------|------|----------|
| 基于距离 | K-近邻 | 简单直观,无需训练 | 小规模数据,实时分类 |
| 基于边界 | 支持向量机 | 泛化能力强 | 小样本,高维数据 |
| 基于树结构 | 决策树 | 可解释性强 | 特征重要性分析 |
| 无监督学习 | K-均值 | 自动发现模式 | 客户分群,图像分割 |
| 深度学习 | 神经网络 | 处理复杂模式 | 图像、语音识别 |
这些简单的Python代码示例为初学者提供了模式识别的入门实践,每个例子都包含了完整的数据处理、模型训练和结果评估流程[ref_6]。通过运行这些代码,可以快速理解模式识别的基本概念和实现方法。