mirror of
https://github.com/rohitg00/ai-engineering-from-scratch.git
synced 2026-10-02 01:54:39 +08:00
chore(i18n): vi / 04-computer-vision (NLLB-200)
This commit is contained in:
@@ -1,22 +1,22 @@
|
||||
{
|
||||
"phases/04-computer-vision/01-image-fundamentals/docs/en.md": "0d8d07b6d715aa8708870dd43216a0c9a4757b2ce570b6e34643f9ec4987af28",
|
||||
"phases/04-computer-vision/01-image-fundamentals/docs/en.md": "a1c3b51b94cc6bdf13f5b1b23e29275d6004fe0c7e226a7b0fbc1a6db95aacb8",
|
||||
"phases/04-computer-vision/02-convolutions-from-scratch/docs/en.md": "ee7e94efac71346b107d1e0d49de3f61bec95937e30f82bc2aa836bc7757c0ea",
|
||||
"phases/04-computer-vision/03-cnns-lenet-to-resnet/docs/en.md": "d0481e111f38c7b8dc4af048a84d75fe8d9043a5431b90c9b06675e66925d27a",
|
||||
"phases/04-computer-vision/04-image-classification/docs/en.md": "1e1ade21c3e7dfe6025da6200e8d510bc64459c00714762c853d87923579eed0",
|
||||
"phases/04-computer-vision/05-transfer-learning/docs/en.md": "670f74b6d6cc2d6d61d56c868c50c482b9cd77fd3580dc427902dee9666c60a5",
|
||||
"phases/04-computer-vision/06-object-detection-yolo/docs/en.md": "2274e5867a4df25fb17a700b8ad129fa6a45b6eb1aebf0673af7a2bc95bb2a79",
|
||||
"phases/04-computer-vision/07-semantic-segmentation-unet/docs/en.md": "7470d67edf0cf2a46debab0ca1e52fa255926e5c121ef17e665112790102f29f",
|
||||
"phases/04-computer-vision/07-semantic-segmentation-unet/docs/en.md": "7c1b00723a204bfc263ea5c3c3219b04b1549a7d2fc7e3297a4a6611609e54f1",
|
||||
"phases/04-computer-vision/08-instance-segmentation-mask-rcnn/docs/en.md": "b7ced123dcc47406affd5cc13916ffb6954f8417a29d8b99526c61ec97a4168b",
|
||||
"phases/04-computer-vision/09-image-generation-gans/docs/en.md": "dcdc65b519fc2a23620cde11212f4d3269b63bd52d568d72ef08c04867c33409",
|
||||
"phases/04-computer-vision/10-image-generation-diffusion/docs/en.md": "596c04cae482ef2dd4aae5b11e7452c9fa9bfe74a44047286ed296a5ea5634cd",
|
||||
"phases/04-computer-vision/11-stable-diffusion/docs/en.md": "1122092bff5852878671ba64ee20fecc680e1e3d7aae15ff367a68f651a56d5e",
|
||||
"phases/04-computer-vision/11-stable-diffusion/docs/en.md": "f2940ee23e490fe19538347b5848aa5ebdee87848e8e2edcca1377f557c6ff09",
|
||||
"phases/04-computer-vision/12-video-understanding/docs/en.md": "34e81835e8d37aa76defa8bdc0940b3b04ff308755b27aec9db7d2236755d3fa",
|
||||
"phases/04-computer-vision/13-3d-vision-nerf/docs/en.md": "c91398ef171ce0b74699c08f47544c013b8fb0db493fa8719034051d08c3b169",
|
||||
"phases/04-computer-vision/14-vision-transformers/docs/en.md": "170c3c598b6f80c58cf371afa9002b5fb47bd4fbeaa9400b84293afee02eb2c0",
|
||||
"phases/04-computer-vision/15-real-time-edge/docs/en.md": "d6bbcacd97a751f0923f32ee3625d27d660640bedaa78521b06dd41cc5c9f9ee",
|
||||
"phases/04-computer-vision/15-real-time-edge/docs/en.md": "67456ce0e428e1ffa31eacece531fc95a2eec306f375a994f21571109e76642e",
|
||||
"phases/04-computer-vision/16-vision-pipeline-capstone/docs/en.md": "8f658578957bb2c27e48dd1926960ebc448d5030d5c21e3dd8398443689f9b73",
|
||||
"phases/04-computer-vision/17-self-supervised-vision/docs/en.md": "66a6b4b1a00ffd0c876bd52e43da023d00d1a9fa138f169d34442481ad8d82b9",
|
||||
"phases/04-computer-vision/18-open-vocab-clip/docs/en.md": "46eaa09a8e7e440033fdf9d3890e4fb679b54b1f0f1428b5117607275270ee10",
|
||||
"phases/04-computer-vision/18-open-vocab-clip/docs/en.md": "7c62736dc19a39acdbec6499254e943c83a8c14023a1ed0979462fc8a3fbebe1",
|
||||
"phases/04-computer-vision/19-ocr-document-understanding/docs/en.md": "7d3780797a294b83dc498521397a2dba8c180ef07541faaa5092d6ad655e714e",
|
||||
"phases/04-computer-vision/20-image-retrieval-metric/docs/en.md": "242ab4be9b9dc567f743984958434792bb3642856d2d776d079d27b6bc1060e5",
|
||||
"phases/04-computer-vision/21-keypoint-pose/docs/en.md": "88644bb7be201d54db0db32f6923a932673219bc5bef4664afa604be5c8a663d",
|
||||
@@ -24,7 +24,7 @@
|
||||
"phases/04-computer-vision/23-diffusion-transformers-rectified-flow/docs/en.md": "422060f3286899edcccdb97e17eda8c8f426a18c38116cbe0ef210ebda4aa606",
|
||||
"phases/04-computer-vision/24-sam3-open-vocab-segmentation/docs/en.md": "56e317c037a7b9fb92c05d8738f795c30b11e5cc3e082127984a1ca25a2bd040",
|
||||
"phases/04-computer-vision/25-vision-language-models/docs/en.md": "8998f05f5d863f11139112ef6d845dce76cd3efc7756d6ea040ccb3bad018578",
|
||||
"phases/04-computer-vision/26-monocular-depth/docs/en.md": "fe028ab042b796794be164531fd758573b48769f4afe359fd3c397d1a405cd32",
|
||||
"phases/04-computer-vision/26-monocular-depth/docs/en.md": "47580e0cea05da1ab7b06b7aa0e1cdda34c405fe64b1e8717e2f2cf1696d0aaf",
|
||||
"phases/04-computer-vision/27-multi-object-tracking/docs/en.md": "c94305127796ce8683c9625ebc1897373e86de8c1da82580815f656988c09e7c",
|
||||
"phases/04-computer-vision/28-world-models-video-diffusion/docs/en.md": "2b64fd3dbecb74fbc2cf8c017468033e16d103409dce31b25b62100838991acd"
|
||||
}
|
||||
@@ -440,7 +440,7 @@ Bài học này mang lại:
|
||||
|
||||
## Đọc thêm
|
||||
|
||||
- [Charles Poynton — A Guided Tour of Color Space](https://poynton.ca/PDFs/Guided_tour.pdf) cách xử lý kỹ thuật rõ ràng nhất về lý do tại sao có quá nhiều không gian màu sắc và khi mỗi một trong số đó quan trọng
|
||||
- [Charles Poynton — A Guided Tour of Color Space](https://web.archive.org/web/20251220000525/https://poynton.ca/PDFs/Guided_tour.pdf) cách xử lý kỹ thuật rõ ràng nhất về lý do tại sao có quá nhiều không gian màu sắc và khi mỗi một trong số đó quan trọng
|
||||
- [PyTorch Vision Transforms Docs](https://pytorch.org/vision/stable/transforms.html) toàn bộ đường ống biến đổi bạn thực sự tạo ra trong sản xuất
|
||||
- [How JPEG Works (Colt McAnlis)](https://www.youtube.com/watch?v=F1kYBnY6mwg) một tour du lịch trực quan sắc nét của mẫu phụ chroma, DCT, và tại sao JPEG mã hóa YCbCr thay vì RGB
|
||||
- [ImageNet Preprocessing Conventions (torchvision models)](https://pytorch.org/vision/stable/models.html) nguồn gốc của sự thật cho `mean=[0.485, 0.456, 0.406]`và tại sao mọi người mẫu trong vườn thú đều mong đợi nó
|
||||
|
||||
@@ -400,4 +400,4 @@ Bài học này mang lại:
|
||||
- [U-Net: Convolutional Networks for Biomedical Image Segmentation (Ronneberger et al., 2015)](https://arxiv.org/abs/1505.04597) giấy gốc; hình ảnh mọi người sao chép là trên trang 2
|
||||
- [Fully Convolutional Networks (Long et al., 2015)](https://arxiv.org/abs/1411.4038) báo cáo đầu tiên làm cho phân đoạn một vấn đề kết thúc đến kết thúc con
|
||||
- [segmentation_models_pytorch](https://github.com/qubvel/segmentation_models.pytorch) tham chiếu cho phân đoạn sản xuất; mỗi kiến trúc tiêu chuẩn cộng với mỗi lỗ tiêu chuẩn
|
||||
- [Lessons learned from training SOTA segmentation (kaggle.com competitions)](https://www.kaggle.com/code/iafoss/carvana-unet-pytorch) một thông tin về lý do tại sao TTA, nhãn giả và trọng lượng lớp quan trọng đối với dữ liệu thực
|
||||
- [iafoss, Unet34 submission with TTA (Kaggle notebook)](https://www.kaggle.com/code/iafoss/unet34-submission-tta-0-699-new-public-lb) Tăng thời gian thử nghiệm cho một U-Net trên một cuộc thi phân đoạn thực
|
||||
|
||||
@@ -193,13 +193,16 @@ Các pixel trắng trong mặt nạ là khu vực để tái tạo.
|
||||
### Bước 5: LoRA
|
||||
|
||||
```python
|
||||
pipe.load_lora_weights("sayakpaul/sd-lora-ghibli")
|
||||
pipe.load_lora_weights(
|
||||
"artificialguybr/studioghibli-redmond-1-5v-studio-ghibli-lora-for-liberteredmond-sd-1-5",
|
||||
weight_name="StudioGhibliRedmond-15V-LiberteRedmond-StdGBRedmAF-StudioGhibli.safetensors",
|
||||
)
|
||||
pipe.fuse_lora(lora_scale=0.8)
|
||||
|
||||
image = pipe(prompt="a village square in ghibli style").images[0]
|
||||
image = pipe(prompt="a village square, StdGBRedmAF, Studio Ghibli").images[0]
|
||||
```
|
||||
|
||||
`lora_scale`kiểm soát sức mạnh; 0,0 = không có hiệu ứng, 1,0 = hiệu ứng đầy đủ. `fuse_lora`làm cho bộ điều chỉnh nạp vào trọng lượng để tăng tốc, nhưng ngăn chặn sự thay đổi.`pipe.unfuse_lora()`trước khi tải một bộ chuyển đổi khác.
|
||||
Câu khởi động từ thẻ mô hình (`StdGBRedmAF, Studio Ghibli`) bật phong cách. `lora_scale`kiểm soát sức mạnh; 0,0 = không có hiệu ứng, 1,0 = hiệu ứng đầy đủ. `fuse_lora`làm cho bộ điều chỉnh nạp vào trọng lượng để tăng tốc, nhưng ngăn chặn sự thay đổi.`pipe.unfuse_lora()`trước khi tải một bộ chuyển đổi khác.
|
||||
|
||||
### Bước 6: đào tạo LoRA (phác thảo)
|
||||
|
||||
|
||||
@@ -270,5 +270,5 @@ Bài học này mang lại:
|
||||
|
||||
- [EfficientNet (Tan & Le, 2019)](https://arxiv.org/abs/1905.11946) quy mô hợp chất cho các kiến trúc hiệu quả
|
||||
- [MobileNetV3 (Howard et al., 2019)](https://arxiv.org/abs/1905.02244) kiến trúc di động đầu tiên với h-swish và squeeze-excite
|
||||
- [A Practical Guide to TensorRT Optimization (NVIDIA)](https://developer.nvidia.com/blog/accelerating-model-inference-with-tensorrt-tips-and-best-practices-for-pytorch-users/) làm thế nào để thực sự có được các số thông qua trong giấy
|
||||
- [Accelerating Inference Up to 6x Faster in PyTorch with Torch-TensorRT (NVIDIA)](https://developer.nvidia.com/blog/accelerating-inference-up-to-6x-faster-in-pytorch-with-torch-tensorrt/) làm thế nào để thực sự có được các số thông qua trong giấy
|
||||
- [ONNX Runtime docs](https://onnxruntime.ai/docs/) định lượng, tối ưu hóa biểu đồ, lựa chọn nhà cung cấp
|
||||
|
||||
@@ -224,4 +224,4 @@ Bài học này mang lại:
|
||||
- [CLIP: Learning Transferable Visual Models from Natural Language Supervision (Radford et al., 2021)](https://arxiv.org/abs/2103.00020)
|
||||
- [SigLIP: Sigmoid Loss for Language-Image Pre-Training (Zhai et al., 2023)](https://arxiv.org/abs/2303.15343)
|
||||
- [OpenCLIP](https://github.com/mlfoundations/open_clip) cơ sở mã cộng đồng
|
||||
- [DINOv2 vs CLIP vs MAE: a features comparison](https://huggingface.co/blog/dinov2) HF hướng dẫn với các trường hợp sử dụng bên cạnh
|
||||
- [Oquab et al. (2023). DINOv2: Learning Robust Visual Features without Supervision](https://arxiv.org/abs/2304.07193) giấy, với các điểm tham khảo tính năng so với các mô hình CLIP và MAE
|
||||
|
||||
@@ -192,21 +192,21 @@ print(f"before align absRel = {abs_rel_error(pred, gt):.3f}")
|
||||
print(f"after align absRel = {abs_rel_error(aligned, gt):.3f}")
|
||||
```
|
||||
|
||||
### Bước 5: Độ sâu bất cứ điều gì sử dụng V3 (chỉ dẫn)
|
||||
### Bước 5: Độ sâu bất cứ điều gì sử dụng V2 (chỉ dẫn)
|
||||
|
||||
```python
|
||||
import torch
|
||||
import numpy as np
|
||||
from transformers import pipeline
|
||||
from PIL import Image
|
||||
|
||||
pipe = pipeline(task="depth-estimation", model="LiheYoung/depth-anything-v2-large")
|
||||
pipe = pipeline(task="depth-estimation", model="depth-anything/Depth-Anything-V2-Large-hf")
|
||||
|
||||
image = Image.open("street.jpg").convert("RGB")
|
||||
out = pipe(image)
|
||||
depth_np = np.array(out["depth"])
|
||||
```
|
||||
|
||||
Ba dòng.`out["depth"]`là một PIL thang xám; chuyển đổi thành numpy cho toán học. Đối với Depth Anything V3 cụ thể, thay đổi ID mô hình một khi được phát hành; API không thay đổi.
|
||||
Ba dòng.`out["depth"]`là một thang độ xám PIL; chuyển đổi thành numpy cho toán học. Depth Anything 3 (Triều 11 năm 2025) không tải thông qua đường ống này. Nó vận chuyển riêng nó `depth_anything_3`gói: `DepthAnything3.from_pretrained("depth-anything/DA3MONO-LARGE")`Load mô hình đơn hình tương đối, và `model.inference(images).depth`trả lại một `[N, H, W]`Dòng độ sâu.
|
||||
|
||||
## Sử dụng nó
|
||||
|
||||
|
||||
Reference in New Issue
Block a user